中文参考
对于开发人员来说,又一次精彩的发布:它比LLM快20- 200倍,因为它完全跳过了逐代币生成。 TypSafe AI刚刚推出Jev, > 20- 200倍快 >40- 400倍便宜(含免费输出代币) >针对决策进行优化的前沿可组合智能 因此,Jev是一个人工智能模型,旨在做出软件决策,而不是为人们编写文本。 正常的LLM通过顺序生成令牌来回答,因此软件通常必须请求结构化输出、解析它、验证它并决定接下来会发生什么。 Jev删除了翻译层:给它一些数据和预定义的问题,它就会返回带有概率和置信度的输入选择或分数。 例如,支持应用程序可以询问票证是否紧急、是否违反政策以及哪个队列应该接收票证,然后直接对这些答案采取行动。 在代码中,Jev的行为就像一个智能的如果陈述:普通软件控制工作流程,而模型则处理严格规则难以处理的模糊判断。 Jev并行评估多个结构化问题,而不是逐个标记地写答案。 TypSafe报告70- 500 ms响应,性能比同类LLM快40- 200倍
原帖全文 / EN
Another brilliant launch for developers: and its 20-200x faster than LLMs because it skips token-by-token generation entirely. TypeSafe AI just launched Jev, > 20-200x faster >40-400x cheaper (w/ output tokens free) > Frontier composable intelligence optimized for decisions So Jev is an AI model built to make software decisions instead of writing text for people. A normal LLM answers by generating tokens sequentially, so software often has to request structured output, parse it, validate it, and decide what happens next. Jev removes that translation layer: give it some data and a predefined question, and it returns a typed choice or score with probabilities and confidence. For example, a support app can ask whether a ticket is urgent, whether it violates policy, and which queue should receive it, then act on those answers directly. In code, Jev behaves like a smart if-statement: ordinary software controls the workflow while the model handles fuzzy judgments that rigid rules struggle with. Jev evaluates multiple structured questions in parallel rather than writing an answer token by token. TypeSafe reports 70-500ms responses and 40-200x faster performance than comparable LLMs
- 浏览
- 1.7万
- 点赞
- 144
- 收藏
- 63
- 转发
- 18
引用帖
Diogo Almeida @CompleteSkeptic
在共同发明ChatGPT后,我不断问自己:为什么超人聊天模型没有导致AGI? 过去两年,我一直在秘密开发一种新的模型训练方法(RLCD),以及我们今天发布的一种新型前沿人工智能模型:Jev ·快20- 200倍 · 40-400x https://t.co/JSybNG2BKJ
查看 X 原帖 ↗转载与衍生
当您访问Jev时要做的4件事: 1.不要更换你的模型,把Jev放在它前面 Jev首先做出了小小的选择,而您昂贵的型号只在真正需要时运行 一个电子邮件工具将每封电子邮件2个人工智能呼叫替换为1个Jev呼叫,并保留所有正常安全检查 120票测试:Jev在前面42秒-没有它22分钟 成本:$0.0003-$0.059 运行该测试的人表示,他的慢速版本因再试错误而减慢得更多,因此真正的差距较小 如何做到: - 查看您的人工智能呼叫代码,这些呼叫只选择某些内容而从不写文本 - 在您自己的代码中写下可能的答案列表,不要让模型创造它们 - 将该列表发送给Jev,并保留您的旧电话作为备份 - 将其放在开/关开关后面,以便您可以在一行中撤销它 - 运行一周并比较它们,然后再删除旧的 您不是在重建您的产品,而是在更换一个电话 2.问5个小问题而不是1个大问题 有人对Jev进行了2,000封网络钓鱼电子邮件测试 问一个大问题,答案是89.4% 简单的2行文本规则获得91.8% Claude Haiku 4.5问同样问题的得票率为94.2% 因此,当必须单独给出最终答案时,Jev甚至输给了文本规则 然后他问了5个小问题,并将答案添加到自己的代码中 95.0%,整个测试成绩最好 模型、 如何做到: - 回答你要问的大问题 - 写下一个人在回答之前检查的5件事 - 分别询问每个人,都在同一个请求中,它们同时运行,几乎不需要额外的费用 - 使用您自己的权重将答案添加到您自己的代码中 - 在您已经知道正确答案的100个示例上测试这些权重- 更改选项的顺序并再次运行,重新排序4个选项更改了7个答案(满分120个) Jev善于注意事物,但不善于做出最终决定 因此将最后一次呼叫保留在您的代码中 3.永远不要问Jev是否能回答 在120张测试票上,有任何诸如“你有足够的信息吗?”的问题”其中85%的人说是 一个简单的“需要更多信息”标志对120张门票中的119张表示“是”,然后它回答了这些门票的正确率约为87% 它不知道它不知道的事情 如何做到: - 删除“你能回答这个问题吗”或“有足够的上下文”等任何问题 - 使每个选项都成为您的代码可以运行的实际操作 - 始终阅读信心分数,而不仅仅是答案 - 根据风险选择您的限制:读取数据为低,无法撤销的任何内容为0.85+ - 将低于限额的所有内容发送给人类或您的大模特 在同一测试中,使用0.8作为限制,人类通过了30个病例,其中93%的病例通过了正确的原因 4.在您已有的东西旁边安静地运行它 已经发布了一个langchain包,并且正在审查一个pydantic-ai适配器,所以这更接近于设置更改而不是重建 如何做到: - 让你当前的系统负责,它仍然会做出每个决定 - 把同样的输入也发送给Jev,然后把它的答案扔掉 - 将两个答案加上Jev的信心分数保存到一个表格中 - 一周后,只看两人意见不一致的那排 - 仅在Jev是对的情况下才切换 该分歧列表成为您的测试集,您的正常流量免费构建它 并且当您已经标记了数据时不要使用它 如果问题永远不会改变,并且您有示例可供训练,那么您自己托管的小型模型在速度和价格上击败了Jev,并且根本不需要API密钥当你没有标签数据并且问题不断变化时,Jev获胜 因此,在答案列表很短且问题很无聊的情况下使用它 无论如何,那是你的大部分经纪人 上面的一切都来自其他人的公开测试,而不是来自生产,因为模型只有4天出生 我只是在测试这个并尝试让自己公司的工作更快、更便宜时分享我的发现 明天我将向您展示当我让Jev负责我们为一个大客户所做的Meta广告工作时会发生什么 无论如何,你们中的大多数人仍然在等待名单上 因此,从第一步开始,因为它不需要访问,也不需要API密钥:在代码中找到最初从未编写任务的调用 GL https://t.co/pCaKGTaxrY
AIGCLINK @aigclink前OpenAI研究员Diogo Almeida发布了一款新型模型:Jev,一种“放弃生成文字只输出类型化概率决策”的模型 称速度快40–200倍,输入成本便宜5–238倍,输出接近免费 就是说把大模型从会聊天会写长文的生成器,改成软件可以直接调用的概率决策函数 用并行概率决策替代逐token字符串生成,主打结构化、可校准、低延迟、低成本 创始人Diogo Almeida称曾在OpenAI参与指令跟随/对话方法相关研究,他的问题是:模型聊天能力早已超过人,但真正可嵌入代码的自动化仍缺关键一环 Jev背后是一套全新栈:新架构、并行采样器以及新训练方法RLCD 像前沿智能函数调用,输入非结构化状态/程序状态,输出预先定义好的类型化概率决策。放弃自由字符串生成,换来无类型错误、schema内不生成非法/幻觉式输出,并自带置信度 它抢的应该是海量的微决策场景,每一次请求背后几十上百个小判断的基础设施层 可塞进业务系统里做判断器,作为分类、路由、打分、抽取,实时应用里的快速判断,工作流里的“智能if”等 如果真能把每次判断压到毫秒级、接近零输出成本、附带置信度,那这个还是有价值的 #Jev #新型模型
烟花老师 @teach_fireworks我快速看了Jev的一些公开帖子和官方文档说明以及例子,终于有人AI模型关心速度,幻觉和成本,而且Jev不是一个大语言模型,这是它能做到这么极致的原因! 官方也给出了好几个例子,比如模型路由和LLM安全护栏。 所以在大语言模型狂奔3年后,AI模型的新的分叉出现了: 不是大尺寸,不是语言模型,极低的幻觉,成本,极快的速度和准确率,没有太多的推理。 几乎每一条都是和LLM反着来的。 不得不多,这个方向真的非常对,希望早点体验到它。 下面这个视频来自官方demo一个并行化的例子,真的快如闪电,成本极低! 这几篇来自官方的文章一定要看看: https://t.co/bm5dYnjZ9O https://t.co/6ZXGhuISMh https://t.co/iFBnlbp1XI https://t.co/HId6Dkb5se https://t.co/M5lBmItSON
Pascual ⚡ @0xPascualJev上周从隐形发货,但没有人谈论这件事。 设置:ChatGPT的一位原始合著者花了两年时间构建了一个无法生成文本的人工智能。 Surface Story:它不是一个更便宜的聊天机器人。它是一个决策引擎。你问它一个自然语言问题--“这张票听起来有欺诈性吗?”'-它不会写一个段落,而是返回一个数字。0.8意味着80%是的。您也可以定义自己的类别:恼火、恼怒、愤怒,并且它会返回每个标签的概率。将其视为您业务逻辑的智能如果陈述。 Twist:有趣的部分是建筑。它不会逐令牌生成,因此以毫秒为单位回答。TypSafe声称比LLM通话快20至200倍,便宜40至400倍。价格为每百万输入令牌0.042美元,输出是免费的,并且有官方的Python和JavaScript TypeScript SDK。平行问题同时运行。您不再将LLM视为数据提取器,而是开始将其视为具有校准置信度的分类器。 隐藏现实:真正的用例是代理护栏。在您的代理启动工具调用或花钱之前,Jev会返回操作错误的可能性。这就是赌注--代码加人工智能,模型对选项进行评分,而您的代码决定如何继续。不是另一个漫无目的并破坏您的管道的聊天包装器。 人工智能揭秘:数学就是故事。与前沿LLM定价相比,每百万个输入代币0.042美元,免费输出意味着一百万次分类呼叫的成本低于规模上单个GPT-4 o提示。按照典型的票务发送量(假设每月5000万个决策)计算,推断费用大约为2.10美元。与俳句级定价相比,差距是结构性的。权衡:它仅限等候名单,演示仅限于视频游戏控制和维基百科链接选择,并且缺少基准。没有公开评价意味着校准信心的说法仍然未经证实。 讽刺接近:疯狂的是,我们生活在这样一个时间轴上,ChatGPT合著者多年来最有趣的作品是一个拒绝说话的模型,而市场已经将OpenAI定价为2%的最爱,以在9月底之前在Polymarket上持有最佳模型,低于Anthropic的97%-而他们无法发货的实际产品是在毫秒内做出决策的产品。呼叫它。 https://t.co/MzLLsSgj62
来源
本页为独立社区整理,仅展示公开原帖与来源链接。媒体、文本、账号信息及商标权利归原作者和原平台所有。
