hermes-ai.net

查看文档 →
HermesHermes Agent 中文文档
← 返回案例库
Case / 2100953553917313180编程
案例媒体 / 1MP4 ↗

Remek Kinas

@KinasRemek
已认证

中文参考

jav @typesafeai - 我感到非常印象深刻🤩 真棒。我又编写了一个演示程序。我认为现在可以明显看到该模型的强大之处了……它能够识别真正有价值的内容。 活动一 - X射线模式:“一次提问,同时处理所有问题”——以简短的新闻稿为例,这种模式下在约1秒内可以完成67次评估,价格为0.0002美元;而对于较长的报告来说,可能需要在1.5秒内完成145次评估,价格为0.0005美元。由于不需要额外的代币,因此每增加一个问题,只需要支付单个问题的代币成本而已。看看如何动态地分类信息,同时询问多个方面的内容吧。活动一可以回答“同时需要多少次评估”以及“需要多少时间”的问题。🥳😍😍😍 活动二 - 消防水管模式:“AI作为现实时间循环中的依赖关系”——我连接到了Wikimedia的公开数据流(stream_wikimedia_org)。我过滤了英语版维基百科、主页面以及人类用户(而非机器人)。对于每一个条目,我通过REST API获取真实的差异信息,该接口返回的是结构化数据而不是HTML格式的数据。然后,我提出8个问题来评价这个编辑:是否包含垃圾内容、是否包含广告性内容、是否针对个人进行攻击、是否为测试目的而编辑、是否删除某些内容、是否有来源不明的声明、以及“造成多少损害”(0-3分)以及“应该采取什么措施”。在75秒内完成了71次编辑,平均每秒1.0个决策,中位时间为306毫秒,每小时评估整个维基百科的成本为0.19美元。分布情况为:49个保留原样/20个交给人工处理/2个撤销。活动二主要关注的是“在哪里”,也就是这些内容可能存在于现实时间循环中的核心部分。 活动三 - 自主性。TypeSafe并不发布关于“智能水平”的基准测试。他们只公布速度和成本,这其实很容易验证。那么,模型是否知道何时是正确的呢?这就需要用户来测量了。我进行了测试。向语音助手提出了300个问题,有150种可能的意图,其中五分之一的意图是要求助手执行一些根本不相关的操作。就这一轮测试而言…… 当准确率达到0.90时,还额外提出了一个关于范围的问题:- 62% ruchu obsilon uguje siðsamo,bez czowieka - 99% z tego jest Poprawne -> konkretnie 2 bððdne odpowiedzi na 186 - 100% zapytaðspoza zakresu zatrzymanych - pozostaðe 114 lðduje w kolejce do czowieka Wykres po prawej jest waðniejszy niejete Liczby。OðX jakie prawdopodobieðstwo模特zadeklarowað。OðY jak czðsto faktycznie miaðracjð。普热科特纳到乌奇沃维奇。Gdy mówið0.99 trafiaðw 99%。Rzecz,o której siðnie mówi:sama pewnoğić NIE wyðapuje zapytaðspoza zakresu。Choice jest relatywny zawsze musi kogoðwskazić,wiðc Wyoka pewnoğić znaczy ' ta opcja wygraða z resztð ',a nie ' ta opcja jest dobra '。 丹麦人:ðC 150,publiczny zbiór。卡佐维奇:~20克朗至4美分。 第三章:我给你打电话(pomiar jakoonci)。

原帖全文 / PL

jav @typesafeai - jestem pod wrażeniem 🤩 Cool. Napisałem kolejne demo. Myślę, że teraz to widać potęgę modelu ... i o co chodzi i widać prawdziwą wartość biznesową. Akt I - X-ray: „jedno zapytanie, wszystkie pytania naraz" - dla przykładowej, krótkiej notatki prasowej to 67 osądów w ~1 s za $0.0002; dla dłuższego RAPORTU może być i 145 osądów w 1,5 s za $0.0005. Skoro nie ma tokenów wyjściowych, to dorzucenie kolejnego pytania kosztuje tylko tokeny samego pytania. Zobaczcie jak można dynamicznie klasyfikować i jednocześnie pytać o wiele wymiarów. Akt I odpowiada na pytanie „ile" osądów naraz i za ile. 🥳😍😍😍 Akt II - Firehose: „AI jako zależność w pętli czasu rzeczywistego" - podłączyłem się do publicznego strumienia SSE Wikimedia (stream_wikimedia_org). Filtruję: angielska Wikipedia, przestrzeń główna, człowiek (nie bot). Dla każdej pobieram prawdziwy diff przez REST compare, który zwraca strukturę zamiast HTML-a. Potem 8 pytań o tę edycję: wandalizm, spam promocyjny, atak na osobę, edycja testowa, usuwanie treści, twierdzenie bez źródła, Score „ile szkody" (0–3) i Choice „co zrobić". 71 edycji w 75 sekund, 1,0 decyzji/s, mediana 306 ms, $0,19 za godzinę oceniania całej Wikipedii. Rozkład: 49 zostaw / 20 do człowieka / 2 cofnij. Akt II to „gdzie", że to może siedzieć w pętli czasu rzeczywistego, w rdzeniu systemu. Akt III - autonomia. TypeSafe nie publikuje benchmarków „poziomu inteligencji". Publikuje prędkość i cenę, czyli dokładnie to, co i tak łatwo zweryfikować. Czy zatem model wie, kiedy ma rację zostaje do zmierzenia użytkownikowi. No to zmierzyłem. 300 zapytań do asystenta głosowego, 150 możliwych intencji, a jedna piąta z nich prosi o coś, czego asystent w ogóle nie obsługuje. Jeden przebieg. Przy progu 0.90 z dodatkowym pytaniem o zakres: - 62% ruchu obsługuje się samo, bez człowieka - 99% z tego jest poprawne -> konkretnie 2 błędne odpowiedzi na 186 - 100% zapytań spoza zakresu zatrzymanych - pozostałe 114 ląduje w kolejce do człowieka Wykres po prawej jest ważniejszy niż te liczby. Oś X jakie prawdopodobieństwo model zadeklarował. Oś Y jak często faktycznie miał rację. Przekątna to uczciwość. Gdy mówił 0.99 trafiał w 99%. Rzecz, o której się nie mówi: sama pewność NIE wyłapuje zapytań spoza zakresu. Choice jest relatywny zawsze musi kogoś wskazać, więc wysoka pewność znaczy „ta opcja wygrała z resztą", a nie „ta opcja jest dobra". Dane: CLINC150, publiczny zbiór. Całość: ~20 sekund i 4 centy. Akt III na „czy można na tym polegać" i jak to działa (pomiar jakości).
浏览
6671
点赞
84
收藏
83
转发
0
查看 X 原帖 ↗

来源

本页为独立社区整理,仅展示公开原帖与来源链接。媒体、文本、账号信息及商标权利归原作者和原平台所有。