← Back to case library
Case / 2100953553917313180코딩
Case media / 1MP4 ↗
Localized reading
jav @typesafeai - jestem pod wrażeniem 🤣 멋지네요. Napisałem kolejne 데모. Myślę, że teraz to widać potęgę modelu ... i o co chodzi i widać prawdziwą wartość biznesową. Akt I - 엑스레이: "jedno zapytanie, wszystkie p...
Original post / PL
jav @typesafeai - jestem pod wrażeniem 🤩 Cool. Napisałem kolejne demo. Myślę, że teraz to widać potęgę modelu ... i o co chodzi i widać prawdziwą wartość biznesową. Akt I - X-ray: „jedno zapytanie, wszystkie pytania naraz" - dla przykładowej, krótkiej notatki prasowej to 67 osądów w ~1 s za $0.0002; dla dłuższego RAPORTU może być i 145 osądów w 1,5 s za $0.0005. Skoro nie ma tokenów wyjściowych, to dorzucenie kolejnego pytania kosztuje tylko tokeny samego pytania. Zobaczcie jak można dynamicznie klasyfikować i jednocześnie pytać o wiele wymiarów. Akt I odpowiada na pytanie „ile" osądów naraz i za ile. 🥳😍😍😍 Akt II - Firehose: „AI jako zależność w pętli czasu rzeczywistego" - podłączyłem się do publicznego strumienia SSE Wikimedia (stream_wikimedia_org). Filtruję: angielska Wikipedia, przestrzeń główna, człowiek (nie bot). Dla każdej pobieram prawdziwy diff przez REST compare, który zwraca strukturę zamiast HTML-a. Potem 8 pytań o tę edycję: wandalizm, spam promocyjny, atak na osobę, edycja testowa, usuwanie treści, twierdzenie bez źródła, Score „ile szkody" (0–3) i Choice „co zrobić". 71 edycji w 75 sekund, 1,0 decyzji/s, mediana 306 ms, $0,19 za godzinę oceniania całej Wikipedii. Rozkład: 49 zostaw / 20 do człowieka / 2 cofnij. Akt II to „gdzie", że to może siedzieć w pętli czasu rzeczywistego, w rdzeniu systemu. Akt III - autonomia. TypeSafe nie publikuje benchmarków „poziomu inteligencji". Publikuje prędkość i cenę, czyli dokładnie to, co i tak łatwo zweryfikować. Czy zatem model wie, kiedy ma rację zostaje do zmierzenia użytkownikowi. No to zmierzyłem. 300 zapytań do asystenta głosowego, 150 możliwych intencji, a jedna piąta z nich prosi o coś, czego asystent w ogóle nie obsługuje. Jeden przebieg. Przy progu 0.90 z dodatkowym pytaniem o zakres: - 62% ruchu obsługuje się samo, bez człowieka - 99% z tego jest poprawne -> konkretnie 2 błędne odpowiedzi na 186 - 100% zapytań spoza zakresu zatrzymanych - pozostałe 114 ląduje w kolejce do człowieka Wykres po prawej jest ważniejszy niż te liczby. Oś X jakie prawdopodobieństwo model zadeklarował. Oś Y jak często faktycznie miał rację. Przekątna to uczciwość. Gdy mówił 0.99 trafiał w 99%. Rzecz, o której się nie mówi: sama pewność NIE wyłapuje zapytań spoza zakresu. Choice jest relatywny zawsze musi kogoś wskazać, więc wysoka pewność znaczy „ta opcja wygrała z resztą", a nie „ta opcja jest dobra". Dane: CLINC150, publiczny zbiór. Całość: ~20 sekund i 4 centy. Akt III na „czy można na tym polegać" i jak to działa (pomiar jakości).
- views
- 6.7천
- likes
- 84
- saves
- 83
- reposts
- 0
출처
This independent archive preserves a public post with attribution. Text, media, account details and trademarks belong to their respective owners.
