← Back to case library
Case / 2100953553917313180Lập trình
Case media / 1MP4 ↗
Localized reading
jav @typesafeai - Tôi thật sự ấn tượng 🤩 Tuyệt! Tôi đã viết thêm một bản demo. Giờ có lẽ bạn đã thấy sức mạnh của mô hình, nó dùng để làm gì và giá trị kinh doanh thực sự của nó. Phần I - X-quang: “một truy vấn, mọi p...
Original post / PL
jav @typesafeai - jestem pod wrażeniem 🤩 Cool. Napisałem kolejne demo. Myślę, że teraz to widać potęgę modelu ... i o co chodzi i widać prawdziwą wartość biznesową. Akt I - X-ray: „jedno zapytanie, wszystkie pytania naraz" - dla przykładowej, krótkiej notatki prasowej to 67 osądów w ~1 s za $0.0002; dla dłuższego RAPORTU może być i 145 osądów w 1,5 s za $0.0005. Skoro nie ma tokenów wyjściowych, to dorzucenie kolejnego pytania kosztuje tylko tokeny samego pytania. Zobaczcie jak można dynamicznie klasyfikować i jednocześnie pytać o wiele wymiarów. Akt I odpowiada na pytanie „ile" osądów naraz i za ile. 🥳😍😍😍 Akt II - Firehose: „AI jako zależność w pętli czasu rzeczywistego" - podłączyłem się do publicznego strumienia SSE Wikimedia (stream_wikimedia_org). Filtruję: angielska Wikipedia, przestrzeń główna, człowiek (nie bot). Dla każdej pobieram prawdziwy diff przez REST compare, który zwraca strukturę zamiast HTML-a. Potem 8 pytań o tę edycję: wandalizm, spam promocyjny, atak na osobę, edycja testowa, usuwanie treści, twierdzenie bez źródła, Score „ile szkody" (0–3) i Choice „co zrobić". 71 edycji w 75 sekund, 1,0 decyzji/s, mediana 306 ms, $0,19 za godzinę oceniania całej Wikipedii. Rozkład: 49 zostaw / 20 do człowieka / 2 cofnij. Akt II to „gdzie", że to może siedzieć w pętli czasu rzeczywistego, w rdzeniu systemu. Akt III - autonomia. TypeSafe nie publikuje benchmarków „poziomu inteligencji". Publikuje prędkość i cenę, czyli dokładnie to, co i tak łatwo zweryfikować. Czy zatem model wie, kiedy ma rację zostaje do zmierzenia użytkownikowi. No to zmierzyłem. 300 zapytań do asystenta głosowego, 150 możliwych intencji, a jedna piąta z nich prosi o coś, czego asystent w ogóle nie obsługuje. Jeden przebieg. Przy progu 0.90 z dodatkowym pytaniem o zakres: - 62% ruchu obsługuje się samo, bez człowieka - 99% z tego jest poprawne -> konkretnie 2 błędne odpowiedzi na 186 - 100% zapytań spoza zakresu zatrzymanych - pozostałe 114 ląduje w kolejce do człowieka Wykres po prawej jest ważniejszy niż te liczby. Oś X jakie prawdopodobieństwo model zadeklarował. Oś Y jak często faktycznie miał rację. Przekątna to uczciwość. Gdy mówił 0.99 trafiał w 99%. Rzecz, o której się nie mówi: sama pewność NIE wyłapuje zapytań spoza zakresu. Choice jest relatywny zawsze musi kogoś wskazać, więc wysoka pewność znaczy „ta opcja wygrała z resztą", a nie „ta opcja jest dobra". Dane: CLINC150, publiczny zbiór. Całość: ~20 sekund i 4 centy. Akt III na „czy można na tym polegać" i jak to działa (pomiar jakości).
- views
- 6,7 N
- likes
- 84
- saves
- 83
- reposts
- 0
Nguồn
This independent archive preserves a public post with attribution. Text, media, account details and trademarks belong to their respective owners.
