独立社区观察
大家都在用 Jev 做什么?
一份带原帖来源的真实实验档案:从浏览器循环、Agent 路由,到分类、编程、研究与内容处理,看看开发者如何把 Jev 用进工作流。
浏览全部案例
24 / 202 个案例
Haoran | 公众号:独立开发
@hr98w
视觉版 Jev 来了 https://t.co/x0kzeE3hdx 仿照着社区的思路,把候选结果映射成固定标签,prefill 完直接采样,限制输出 token,采用多模态的 qwen-3.5-0.8B 4bit 量化部署在本地,16g m4 mbp 顺利运行 叠甲:这只是在 infer 层小小的复现一下 jev 的形式,肯定不如各种成熟推理框架效率高,也肯定不是 jev 的正在原理,但是作为 inference 的小入门仍旧是不错的 demo 如下 200ms 实现《三色货品分拣》
2.9万 views · 293 likes · 330 saves
Remek Kinas
@KinasRemek
jav @typesafeai - 我感到非常印象深刻🤩 真棒。我又编写了一个演示程序。我认为现在可以明显看到该模型的强大之处了……它能够识别真正有价值的内容。 活动一 - X射线模式:“一次提问,同时处理所有问题”——以简短的新闻稿为例,这种模式下在约1秒内可以完成67次评估,价格为0.0002美元;而对于较长的报告来说,可能需要在1.5秒内完成145次评估,价格为0.0005美元。由于不需要额外的代币,因此每增加一个问题,只需要支付单个问题的代币成本而已。看看如何动态地分类信息,同时询问多个方面的内容吧。活动一可以回答“同时需要多少次评估”以及“需要多少时间”的问题。🥳😍😍😍 活动二 - 消防水管模式:“AI作为现实时间循环中的依赖关系”——我连接到了Wikimedia的公开数据流(stream_wikimedia_org)。我过滤了英语版维基百科、主页面以及人类用户(而非机器人)。对于每一个条目,我通过REST API获取真实的差异信息,该接口返回的是结构化数据而不是HTML格式的数据。然后,我提出8个问题来评价这个编辑:是否包含垃圾内容、是否包含广告性内容、是否针对个人进行攻击、是否为测试目的而编辑、是否删除某些内容、是否有来源不明的声明、以及“造成多少损害”(0-3分)以及“应该采取什么措施”。在75秒内完成了71次编辑,平均每秒1.0个决策,中位时间为306毫秒,每小时评估整个维基百科的成本为0.19美元。分布情况为:49个保留原样/20个交给人工处理/2个撤销。活动二主要关注的是“在哪里”,也就是这些内容可能存在于现实时间循环中的核心部分。 活动三 - 自主性。TypeSafe并不发布关于“智能水平”的基准测试。他们只公布速度和成本,这其实很容易验证。那么,模型是否知道何时是正确的呢?这就需要用户来测量了。我进行了测试。向语音助手提出了300个问题,有150种可能的意图,其中五分之一的意图是要求助手执行一些根本不相关的操作。就这一轮测试而言…… 当准确率达到0.90时,还额外提出了一个关于范围的问题:- 62% ruchu obsilon uguje siðsamo,bez czowieka - 99% z tego jest Poprawne -> konkretnie 2 bððdne odpowiedzi na 186 - 100% zapytaðspoza zakresu zatrzymanych - pozostaðe 114 lðduje w kolejce do czowieka Wykres po prawej jest waðniejszy niejete Liczby。OðX jakie prawdopodobieðstwo模特zadeklarowað。OðY jak czðsto faktycznie miaðracjð。普热科特纳到乌奇沃维奇。Gdy mówið0.99 trafiaðw 99%。Rzecz,o której siðnie mówi:sama pewnoğić NIE wyðapuje zapytaðspoza zakresu。Choice jest relatywny zawsze musi kogoðwskazić,wiðc Wyoka pewnoğić znaczy ' ta opcja wygraða z resztð ',a nie ' ta opcja jest dobra '。 丹麦人:ðC 150,publiczny zbiór。卡佐维奇:~20克朗至4美分。 第三章:我给你打电话(pomiar jakoonci)。
6.7k views · 84 likes · 83 saves
Yuntian Deng
@yuntiandeng
我越来越认为未来的软件将将控制流代码与用于“模糊”判断的小型神经程序相结合。 这就是我一直在用ProgramAsWeights探索的内容,它回答了这些神经程序来自哪里的问题:它们是从英语描述中“编译”的。 例如,我将30个神经程序与决策树结合起来,构建了一个课程网站助手,它看起来像聊天机器人,但在本地运行。每个小程序都会处理诸如“这应该被路由到哪个专业回答者”这样的问题,代码控制整个流程。 您可以在这里尝试使用它进行构建: https://t.co/Bwgcn362bc
1.3万 views · 171 likes · 140 saves
Sam Enoka
@maybe_im_sam
早上醒来时,很早就可以访问@typesafeai,并且非常兴奋地尝试一下。今天早上上班前做了一个烹饪演示,其中typesafe在我的@threejs动作游戏中驱动了一位AI合作伙伴。可以看到右侧的日志实时跟踪人工智能决策。 Typesafe正在读取游戏状态并选择机器人的意图:何时参与、重组、生存或逃跑。 显然现在有点原始,但这就像是大约1小时的工作。我需要跑去上班,但天哪,我超级兴奋地在这个收件箱上再接再厉😄 今天早上大约10分钟的游戏测试总花费约为0.02美元。我们他妈的走吧😂
6.0k views · 27 likes · 8 saves
Paolo Rosson
@redp314
让Jev审查了我的公关。比Claude便宜约200倍,半秒内即可回复 视频中的6个真实PR。每人0.00007美元。1,000 PR = 7美分,Opus 5约为14.50美元 paste a diff → ONE call to @typesafeai → 14 typed check come back as probabilities: 硬编码的秘密,SQL注入,接触认证,删除测试,中断API,迁移,调试遗留问题,描述是否与差异实际匹配,爆炸半径,审阅者努力...... 代码将其转化为一个判决:BLOCK / security review / nits / merge。任何关键检查不确定的事情(0.35-0.65)都会升级到人类或大模型,而不是猜测
33.1万 views · 2.7k likes · 2.5k saves
Milind S
@milindlabs
好吧,Jev实际上可以很好地使用电脑 没有任何屏幕截图,或者LLM和没有像素离开我的Mac 我甚至没有读过Dom元素 本地CoreML模型分割了屏幕上的每个按钮和UI元素。 设备上OCR读取标签。这条短信就是Jev得到的全部内容。 它返回这些元素的概率,并告诉我最适合单击的元素。 然后它单击,重新运行检测,并再次做出决定。循环,直到目标完成。 每次决定~ 90 ms。比我尝试过的任何LLM计算机都快。 快速使用计算机,没有任何延迟 @typesafeai正在构建一些非常有趣的东西
11.2万 views · 1.6k likes · 1.4k saves
比特币橙子Trader
@oragnes
卧槽,JEV 的出现很可能就是自动智能交易的起点。 昨天JEV在AI 圈刷屏,今天 Monad 工程师就用JEV做了一个自动交易机器人。 实时读取 MON/USDC 价格,JEV 不负责写分析报告,也不跟你解释一堆逻辑,它只做最核心的事,判断 Buy 还是 Sell,再给出置信度,然后直接把交易发到 Kuru 的链上订单簿执行。 这一下我突然明白 JEV 为什么要做成一个不会说话的模型了。 交易根本不需要 AI 每 300ms 给你写一篇小作文,它需要的是: 行情进来→判断→下单→新行情→重新判断,而且这一整套循环必须足够快、足够便宜。 而 Monad 现在刚好每 300ms 出一个区块,Kuru 又是链上订单簿。高性能链负责执行,JEV 负责决策,两个东西拼起来,已经有点AI 原生交易系统的味道了。 未来的交易 Agent,不一定需要一个会写研报的超级大模型,它更需要一个能在极低延迟下连续做几百万次判断的大脑。 昨天我 提交的WL今天也通过了,接下来我先尝尝咸淡,看看到底怎么个事。
63.5万 views · 3.1k likes · 3.7k saves
Hassan
@nutlope
Jev + Kimi K3用于欺诈检测! TLDR:Jev在1.42秒内对100封电子邮件进行了分类,然后我将不确定的案件转发给Kimi K3。完整管道只需花费约0.07美元即可获得96/100的正确性。 视频未加速,查看实时运行! 这是我的过程: 我给了Jev 100封电子邮件进行分类(50封合法电子邮件和50封欺诈电子邮件的混合物)。它在1.42秒内对所有这些进行了分类。 Jev的一个被低估的功能是,它会为您提供分类的置信度分数,因此我将95%置信度以下的任何预测都发送给Kimi K3以完全确定。 31封电子邮件低于该阈值。将这些路由到Kimi K3后,合并后的管道达到了96%的准确率。 完整运行耗时16秒,推断成本约为0.07美元: - Kimi K3在@togethercompute上支付0.068美元 - 0.003美元(1/3美分)来自@typesafeai的Jev。 我认为这是一个非常有趣的模式:使用像Jev这样的快速专用模型来处理窄任务,然后将不确定的情况路由到更大的LLM。 我觉得这种方法可能会改变欺诈或任何实时用例的游戏规则。您可以使用Jev的速度和低成本,同时拥有更大的LLM作为后备,以确保高精度。
5.3万 views · 843 likes · 739 saves
AI/ML API
@aimlapi
Jev VS寓言5.1 VS GPT-6阿斯特拉:国际象棋 typesafe的新Jev V13不是LLM。它不聊天,不解释,不写代码-它只做决定。所以我们让它和边境LLM玩闪电战 测试:5+0闪电战。一举一动都是一次API调用。 Jev V13 vs寓言5.1: ·寓言胜过它。第29步,材料上+16,甚至提拔了第二位女王 ·但分析时每次动作持续燃烧6-15秒。Jev回答时间约为2.6秒 ·所以寓言没有足够的时间而迷失了 Jev V13 vs阿斯特拉: ·阿斯特拉并没有费心在材料上获胜。它以18个动作与Jev对决。QE 1 #,还剩2:27
52.6万 views · 2.2k likes · 749 saves
Hassan
@nutlope
我使用Jev对1,018篇人工智能研究论文进行了分类。 结果:总成本为0.08美元,每张纸张的端到端延迟中位数为256 ms。 管道是: 1.使用DeepSeek V4 Flash总结每份论文 2.将标题+摘要+ 24个可能的主题发送给Jev 3.使用Jev对每张论文进行分类 4.在https://t.co/hs63SlHxjw上可视化所有内容 @togethercompute上的摘要售价为3.99美元。@typesafeai上的分类费用为0.08美元。 因此,只需花费4美元多一点的推断,我最终找到了一种非常有用的方法来探索过去一年的顶级人工智能研究论文。 我认为这就是事情的发展方向:针对工作流程的不同部分使用不同的模型,而不是针对所有内容使用一个模型。 在替换当前的分类之前,我正在对Jev分类进行evals,但该网站已经上线:https://t.co/hs63SlHxjw
15.9万 views · 1.9k likes · 1.9k saves
梭哈.AI
@SUOHA_AI
很多人没看懂爆火的JEV是什么? 所以我做了一个 50 秒的演示视频,带大家把海外刷屏的 JEV 以及它背后的底层架构看透👇(见下方视频) JEV 是前 OpenAI、参与 ChatGPT / RLHF 的 @CompleteSkeptic(Diogo Almeida)创办 @typesafeai 后的第一款模型 他在 OpenAI 时发现了一个致命矛盾: 通过人类偏好微调(RLHF)训练出来的自回归大模型,存在严重的模式崩溃(Mode-dropping)、过度自信与幻觉,且串行逐字生成的延迟极大,根本无法胜任严肃的机器自动化生产 为此,他们花了两年研发了专为自动化设计的 System 1 基础模型 JEV,核心架构创新非常激进: • 单次并行计算(One Parallel Pass): 如同当年 Transformer 取代 RNN 一样,JEV 彻底抛弃了逐 Token 串行吐字的自回归机制,采用全新的模型架构与采样器,一次性并行击发所有预设选项 • 强化学习校准决策(RL for Calibrated Decisions): 引入全新的训练算法,输出媒介不再是自然语言文本,而是直接输出经过置信度校准的概率分布 • 代码级可靠(TypeSafe): 彻底根除幻觉,输出自一致、确定性高,可作为强类型对象直接被程序调用 • 100 倍提速与极端降本: 延迟降至 0.1 秒以内(快到能直接插入 60 FPS 游戏循环);输入每 10 亿 Token 仅 42 美元,输出 Token 彻底免费 视频里我把传统自回归的 8.5 秒延迟瓶颈、JEV 的并行矩阵运算,以及实时控制小游戏实测,全拉通做了可视化, demo参考 @MatijaSosic 聊天需要慢推理,自动化需要快直觉,Building Prod, not God 确实不是一句空话🫡
4.5万 views · 70 likes · 92 saves
Utkarsh Agrawal
@uttkarsh_42
所以我让Jev完全控制猎鹰9级火箭 全面发射到着陆 代码中没有自动驾驶仪,没有脚本轨迹,没有安全否决权 每个决定都是由jev做出的(您可以在视频底部看到决定) 是的,它能够着陆助推器 而所有这一切只需要245个调用和0.04美元的API调用 对于SIM卡,我使用Mujoco 这些布局是42米助推器、425吨重、9台发动机、真实大气层、马赫数相关阻力、风和推进剂消耗 车辆每0.8秒就会崩溃一次,jev的判决发生在~1Hz的频率下,输出时间为~0.4秒 所以我给了jev这些控制 >启动或持有 >每次燃烧的发动机计数(它选择了5个单独着陆!) >何时点燃燃烧 >上升截止、滑行、进入、腿部、达阵 因此,在将所有这些控制交给jev后,实验开始了 经过12次跑动并调整多个东西后,它成功地自行着陆 我会写一篇关于它的完整文章 我做了什么实验, 但最后我想 人们说它只是一个分类器 是的,但它是一个非常好且有效的分类器,其速度和决策为现实生活中的任务和实施开辟了全新的工作 在清理了代码中的混乱之后,我还将为此开源整个仓库 这是简短的演示 I hope you like it
7.5万 views · 109 likes · 49 saves
Remek Kinas
@KinasRemek
在我看来,像JEV这样的模型将会带来巨大的改变。目前的LLM模型模拟的是系统2的运作方式。对我来说,JEV的实现是过去几个月里出现的最新的概念之一。 虽然看起来没什么特别之处(只是一个动态分类器),但令人惊讶的是,要等待这样一个模型这么长时间。其实,一个通用的分类器,一个智能的“if”结构……在我的之前的文章中,我已经解释过这种模型的运作原理了。我可以访问@typesafeai和@CompleteSkeptic的API,因此我在自己的“pac-man”模型中实现了自我学习功能。 这个例子有点“戏谑性”,因为查询的模式是固定的,但在许多系统中,比如智能代理系统,模式以及状态都是随时间变化的(在“pac-man”模型中,只有状态在变化)。在更复杂的系统中,状态的结构以及状态属性的数值都是随时间变化的,分类器的合同条件(类别的数量以及它们的语义)也同样如此。而在这里,我们就有了一个系统1模型——它做出决策。 当然,也可以在LLM上实现这个功能,不过那样会慢一些,成本也会更高,而且需要按顺序处理各个请求(在上下文中可以看到相应的回答)。可以使用基于响应的扩散技术,而不是使用随机数据填充响应模板(这样会更快)——只生成测试样本即可。不过,真正重要的还是系统1这个概念本身。我认为它的应用范围非常广泛:智能应用程序、智能代理系统、用于编码的客户端程序——从而降低成本,提高运行速度,提升解决方案的质量等等。
1.1万 views · 95 likes · 62 saves
Ansh Nanda
@anshnanda
到目前为止,您可能已经在您的时间轴上看到了Jev。 是的,这是一个速度快且便宜的型号。 但它与GPT-6 Astra、Fable 5.1和Deepseek v4.1 Flash相比如何? 在本视频中,我将其与4项不同任务的顶级LLM进行了比较。它赢了吗?还是输了?让我们来看看。 本视频中所有内容的Jev总账单:0.49美元。 章 0:00简介 1:07 Jev到底是什么 2:57系统1与系统2思维 4:36 Jev玩毁灭战士 7:14 Jev如何工作 10:33比特币交易一年 14:26 1,500封电子邮件,每封200 ms 17:58 857张支持票vs Intercom Fin 20:06什么时候应该真正使用它
1.8万 views · 97 likes · 78 saves
梭哈.AI
@SUOHA_AI
完全睡不着了....这个视频让你完全看懂JEV的恐怖能力 我实际演示了一下,用 JEV 和 DeepSeek 做同一个任务:从当天的海量实时新闻流里,为 15 个品牌快速匹配有没有适合借势的公关热点,并打上结构化意图分类标签 结果是:28 秒内,Jev 狂刷完了整整 428 条数据,并完成了全部的目标分解与分类;而同一时间跑在同样任务上的 DeepSeek V4.1-flash,才刚刚完成 6/428 条 速度被拉开了几十倍,答案甚至在你读完第一行字之前就已经返回了.... 为什么会产生这么恐怖的差距?底层逻辑是: • DeepSeek 这种通用模型本质上是在“逐字写文章”: 哪怕你只让它做个最简单的“是/否”判断,它在后台也必须一个词一个词往外推,硬走一遍漫长的生成流程,延迟按秒起步 • Jev 官方定位是“System 1(快决策)”模型,从根上就根本不会写字: 它彻底抛弃了逐字吐词,底层直接一次性并行出结果。不输出半句废话,70 到 200 毫秒内直接甩出代码需要的最终答案(对/错、打分、分类) demo参考@elvissun Github开源:https://t.co/sdyWJhdvfO 建议大家试试JEV,越用越觉得牛逼.....
4.3k views · 15 likes · 44 saves
sengpt
@sengpt
朋友们 我得到了 jev 的早期访问, 并开始测试它, 我不得不说我真的印象深刻 请观看我录制的演示。 这绝对不是一个加速的视频。4 个Jev正在互相玩 101 游戏, 看看游戏的速度。 追随我的人都知道。 多年来,每次新车型问世时, 我都会玩我们著名的 101 OK 游戏。 我的个人基准之一是玩101的AI模型。 “哈没有比这更好的基准进入我们的家。 因为 101 比看上去要难得多 模型首先需要理解游戏的规则, 然后在游戏中完全遵守这些规则。但是这还不够。他需要评估他手中的石头,桌子的状态,即最后状态,以及对手的动作,并及时做出正确的决定。每个模型都需要知道桌子的瞬间状态, 并且能够快速做出决定 尤其是最后一个部分是迄今为止模型最困难的部分 即使 openai, anthropic 等模型可以很好地做出决定, 有时他们也会思考 30 秒或更长时间。在实时游戏中, 做出正确的决定是没有意义的, 因为你做出了正确的决定, 但你错过了轮到你的时候, 这并没有什么好处。因此, 速度 + 正确的决策是这里最重要的指标。 这就是为什么我在宣布之前就开始使用 Early Access 。我记得我的 101 个 Benchmark 实际上, 作为一个概念, Jev并不是一个陌生的东西。 简单来说, 我们可以用 generalized zero-shot classifier 来描述。它不会产生长长的文本, 而是根据给定的状态在定义的选项之间做出决定。 但最美妙的是, 他做得有多快我已经尝试了三到四年的不同型号,但我没有得到完全的效率,似乎解决了AI玩101的问题 在毫秒内做出决定, 并且在游戏中表现得非常准确 第 101 章不是最重要的事 第 101 章这是个小小的小小的 在计算机使用,浏览器使用,需要速度的游戏等领域,也就是说,在模型不断思考我应该做什么的每一个场景中,jev都在加速。对于数百万个小的决定来说, 似乎是非常理想的 一个巨大的生成模型, 30 秒钟思考数百万个微型决策, 实际上是不起作用的。相反, 一个能够在 100 毫秒内做出足够好的决策的模型更有意义。 这就是Jev所做的。 我认为它满足并将满足一个巨大的需求。 请记住, 当没有像 4G 这样的高速互联网基础设施时, 像 tiktok vs 这样的实时流媒体是不可能的。TikTok需要4G或高速互联网。现在, jev = 4g 。解决速度问题。因此,让我们来看看,在未来的学期里, 通过Jev的Toku,Jev将会有什么样的创新。 如果你有一个概念, 需要立即做出数百万个微型决定, 这是非常理想的东西。 我认为像openai和anthropic这样的公司也会逐渐将“生成”和“决策”分开
5.5万 views · 169 likes · 178 saves
李不凯正在研究
@libukai
这两天关于 Jev 这个模型的热度非常之高,甚至可以说是近半年我重点关注了英推以来,看到的原创内容密度最高的一次。 正好我过去一年一直在跑一个小项目,其中有一个环节就是要对每天出版的《人民日报》上的新闻做一个分类,判断每一篇文章中是否包含有湖北相关的元素。 一年跑下来,积累了接近 2 万 4 千条数据,其中判定包含的有 1800 条左右。在这些数据的基础上,我随机筛选了一个测试数据集,其中包含了 500 条判定包含的内容,以及 500 条判定不包含的内容。 之前我使用的模型一直是 Gemini 的 Flash Lite 系列,也算是经过测试后成本和速度双重考虑下的最佳选择。 今天 OpenRouter 上线了这个 Jev 之后,我用同样的提示词做了一个小 Demo 做了一下对比测试,下面这个视频就是同时并发 16 个进程的实录效果。 不得不说,测试出来的结果超出预期很让人惊喜啊。 首先,速度是真快!相对于 Gemini Flash Lite 单篇文章 3 秒的平均耗时,Jev 把单篇耗时缩减到了 0.35 秒。这个接近 10 倍的速度提升,真的是实现了质的飞跃,带了很多新场景的想象空间。 其次,质量也真不错!和 Gemini Flash Lite 的分类结果相比对,Jev 大概在 15% 左右的内容上出现了判断不一致的情况。 但经过我的手动审核,大部分都是因为人名而导致判断差异。例如某位此前在湖北省任职过的官员姓名出现在了新闻中时,Flash Lite 因为知识库比较大,会将其判断为包含,而 Jev 在这块上面会弱一点,因此判定为了不包含。在我的实际应用场景中,这种判断差异完全可以接受。 最后,价格也是真便宜啊!看了一下 OpenRouter 的账单,前前后后大概跑了 5 千条数据,30M Token,总共开销也就 1 美元!这个性价比,还要什么自行车! 总之,我个人觉得 Jev 代表的分类器大模型的确是一个非常有前景的发展方向,甚至可以说是在分类场景下实现了速度/质量/价格的不可能三角,有类似需求的朋友真的可以好好考虑一下。 就分享到这了,我得连夜用它去优化生产项目了。
2.9k views · 27 likes · 25 saves
Niels Rogge
@NielsRogge
介绍带有Code的论文LCP服务器! 为了庆祝它的发布,我请Claude Code通过@typesafeai使用“search_papers”工具研究Jev的架构。 这是它的结果: “如果Jev在架构上是任何公共的东西,那么它就是一个大型模式条件双向编码器,具有并行标签查询头(GLiNER/ML-Decoder形状),用适当的评分规则RL目标(RLCC形状)进行训练,扩展范围远远超过了这些论文操作的~ 150 M参数范围--“既不小,也不LLM”符合这一点。40-200倍的加速与消除自回归是一致的,而不是任何奇异机制。"
1.5万 views · 78 likes · 57 saves
Rory Garton-Smith
@rory_builds
我刚刚构建了Easy-Jev,一个任何人现在都可以尝试的Jev演示! 更改输入并实时查看分类变化。 我的硕士论文是关于分类模型的,所以看到非常有用的算法的现代化版本很有趣 Typesafe是正确的,因为LLM只是智能的一种方法,我认为随着时间的推移,我们将看到dif模型的混合体分解和分配问题的正确部分,总体使用更少的代币并依赖LLM来获得更少的答案。 我看好我所谓的“组合输入”方法:将一个陈述分解为一系列分类,并将每个分类路由到正确类型的模型,而不是仅仅用LLM强行执行整个过程 抄送/ @CompleteSkeptic @typesafeai 下面的链接,请欣赏
1.1万 views · 87 likes · 73 saves
yishan
@tspy
昨晚申请的 Typesafe AI 账号,半夜已通过审批! 幸运之星在此感谢 @typesafeai @CompleteSkeptic 今天抽空写了个 Chrome 插件,通过 Jev 标注 X 平台中帖子内容的意图和概率。 实时判定,并将分类结果以标签的形式展示在时间戳的后面。 分类的类别包括诱导、挑拨、推销、机器生成、说服、娱乐、告知等。 Jev 太疯狂了,几乎秒响应,这在 LLM 上是无法感受到的。 而且我还未细调的情况下,它的分类就已经很精准。 在右侧调出了统计面板,展示大致的使用情况,供大伙参考。 接下来,我会继续将 Jev 整合到更多的产品和工具中。 Jev 是 2026 年度的 AI 之星!
7.1k views · 18 likes · 15 saves
kaize
@0x_kaize
我访问了Jev并立即将其插入Claude Code,看看它是否真的解决了代理工作流程中最大的难题:上下文压缩 >结果:相当狂野 为那些错过它的人提供快速背景: 每个Claude Code会话都有一个上下文窗口,该窗口会快速填充工具调用(文件读取、grep输出、日志等)。 当它填满时,代理运行“压缩”-要求一个单独的LLM总结聊天。这是缓慢的,昂贵的,LLM经常丢弃重要的上下文或用垃圾膨胀摘要: fast-jev-compaction使用Jev代替 链接:https://t.co/WD7kpBfDwL 为什么这么好用: Jev不会生成文本摘要,而是对聊天中的每个工具调用进行评分,并回答“这有多重要?“概率。 >高于阈值→保持它 '下面'删除它或用树桩替换 >总而言之:没有文本生成、没有臃肿、没有丢弃关键上下文 你实际得到的是: 1/更快:Jev并行输出概率,而不是顺序令牌。 2/更便宜:100万个上下文代币=约0.04美元以压缩。 3/确定性:没有“创造性”摘要会删除一半的代码库上下文。 顺便说一句,Typesafe提供5美元的免费积分,足够进行数周的测试。 链接:https://t.co/NzGPArgLvc 诚实的警告: Jev只看到工具Calls,而不是它们的输出,很难说压实质量客观上是否优于默认。 Jev的上下文窗口很小(32 K),因此需要对150 K以上的聊天进行分块。 这不是完全替代品-这是一个智能的预过滤器 而是作为概念的证明。 这正是使代理工作流程大规模可行的外科修复方法。 现在考虑以Jev作为决策层,我的堆栈中还有哪些内容可以提高100倍。
2.5k views · 31 likes · 16 saves
Raihan Khan
@raihankhan_rk
今天早上我通过@typesafeai访问了Jev,并为此构建了一个很酷的用例 引入迪夫Jury-只需粘贴任何公共公关链接,Jev就会立即告诉您合并是否安全或是否需要审查收件箱 🔗随时在这里尝试一下-https://t.co/XxcZxIZJDK 想象一下Jev能够告诉您是否应该将PR与代码库的接地上下文合并。这就是我们在@graphify正在构建的内容👀 Jev的速度有多快真是令人着迷……模型架构本身就非常有趣,这开辟了大量新用例,我相信互联网会比任何人预期的更快地关注它
8.6k views · 79 likes · 61 saves
Alex Stone
@a1exstone
Typesafe发布了一个不生成文本的模型,它打破了代理循环的成本底线 jev是他们所谓的系统一模型。你向它发送一个状态和一组问题,它会返回带有概率的类型化答案。没有令牌,没有采样,没有顺序解码。 路线|决定|守卫|下工具|观察|完成? 它们报告称,分类任务的推理速度比同类LLM快20- 200倍,成本低40- 400倍。请求中的每个问题都是并行评估的,因此添加问题几乎不会改变延迟。 在两圈循环中,这意味着八个决定。需要计划的两个人仍然使用聊天模式。其他六个-选择模型、屏幕工具调用、检查任务是否完成-总共花费0.06秒。 要点很简单:停止为选择支付发电价格。经纪人决定的大部分是选择、得分或是/否。
2.0k views · 29 likes · 17 saves
Ziwen
@ziwenxu_
Jev已经在OpenRouter上了!! 它才推出一天,TypSafe仍然有等待名单。 OpenRouter有它,这就是我们运行它的方式。 定价太疯狂了。每百万个代币0.042美元,输出免费。 如何使用: - 在OpenRouter上注册并添加一些积分 - 制作API密钥 - 调用决策端点:/api/Alpha/decisions - 将模型设置为~typesafe/jev-latest - 向其发送“状态”(正在发生的事情)和“问题”(您想要决定的事情,以及选项) ChatGPT和Claude逐字逐句给您写答案。 Jev根本不写。你给它提供选项,它会发回每个选项的可能性,以及它的信心程度。 我们得到了什么: - “我的卡被充值了两次”大约一秒钟就完成了100%的计费 - 我们将它连接到俄罗斯方块,它在大约半秒内完成每一个动作 - 整场比赛花费不到半美分 这里可以发生很多有趣的事情。
1.2k views · 22 likes · 12 saves
Vlad Dubchak
@vladdubchak_x
Jev对广告研究非常着迷。 我构建了一个工具,可以在1.5秒内对Meta上任何视频广告的每个镜头进行评分。 它在Maxfusion + @typesafeai上运行 我在不到3分钟的时间里就通过它推送了450多个广告。 它从Maxfusion上的研究实验室撤下所有广告商的实时视频广告。 Maxfusion观看了广告并给出了法医分析。 然后Jev对每个镜头进行评判并对整个广告进行评分。 它在1.52秒内做出了50次判断,价格为0.00028美元,并为这则Duolingo广告评分为88分。 Jev是我共事过的最快的决策者。
3.4k views · 12 likes · 23 saves
Aditya A.
@iamAdityaAnjana
昨晚做了一个愚蠢的实验:通过@typesafeai使用Jev(决策/分类器模型,而不是文本生成模型)来编写C++。 在每一步,我都会给它一组语法有效的下一个令牌,然后让它..选一个。没有自由形式的生成,没有幻觉的语法,纯粹是“从这个法律集中选择”。“它不是为此而建的,这就是它有趣的原因。 从根本上不生成文本的模型中获得了C++的工作部分。不要声称这是您应该如何编写代码,而且这比仅使用实际的代码模型更慢、更愚蠢。但这很好地证明了一个受足够严格约束的分类器可能会看起来像一个生成器。 这里的新颖性大于实用性,但这是一种愚蠢的实验,它比官方演示更能告诉你有关模型的实际护栏的信息。
1.2万 views · 49 likes · 18 saves
Kaushik
@0xkaushik_k
很早就访问了@typesafeai Jev,并花了几个小时对其进行了改进。 我不断碰到的问题是:代理跟踪可以告诉您运行了哪个工具,花费了多长时间,返回了什么,但永远不会告诉您代理实际上是否正在进行任何操作。一个代理编辑、测试和恢复同一个文件六次,在日志中看起来非常健康。 所以我制作了JevScope。它观察人工智能代理的工作,并询问Jev每一步实际上意味着什么,这是否与任务一致,是否进展,是否重复,是否陷入困境。每一步都是随着时间的推移而绘制的。 这是一个编码代理陷入比赛条件的情况。注意黄线。 没有日志行写着“我被困住了。“曲线确实如此。 详细的演示、代码和撰写即将推出。
1.2k views · 8 likes · 1 saves
Prakshal Jain
@prakshaljain_
Jev by @typesafeai将您的DeliverMac变成了人工智能代理. 这对你意味着什么? - Jev是ChatGPT共同发明者的一款新型号,可以实时操作计算机工具。 - 除了优化外,计算机使用速度更快200倍,便宜400倍。 - @MitosisLabs的Yappy是一款人工智能,它运行在您的Mac上,并并行执行多项任务。填写工作申请表、填写税务和其他文件、填写表格等等. - 对于Jev,所有这些事情都在眨眼间发生! 以下是演示该IRL的视频。 以下是基准(Yappy + Jev V/S 我们的竞争对手): - 端到端时间:1 m 54 s vs 13 m 14 s - LLM Calls:22 vs 104 - 消耗的输入令牌:0.39 M vs 11.24 M - 运行的估计成本:约0.24美元vs约4.24美元 在评论中下载链接。
324 views · 8 likes · 3 saves
Rohan Paul
@rohanpaul_ai
对于开发人员来说,又一次精彩的发布:它比LLM快20- 200倍,因为它完全跳过了逐代币生成。 TypSafe AI刚刚推出Jev, > 20- 200倍快 >40- 400倍便宜(含免费输出代币) >针对决策进行优化的前沿可组合智能 因此,Jev是一个人工智能模型,旨在做出软件决策,而不是为人们编写文本。 正常的LLM通过顺序生成令牌来回答,因此软件通常必须请求结构化输出、解析它、验证它并决定接下来会发生什么。 Jev删除了翻译层:给它一些数据和预定义的问题,它就会返回带有概率和置信度的输入选择或分数。 例如,支持应用程序可以询问票证是否紧急、是否违反政策以及哪个队列应该接收票证,然后直接对这些答案采取行动。 在代码中,Jev的行为就像一个智能的如果陈述:普通软件控制工作流程,而模型则处理严格规则难以处理的模糊判断。 Jev并行评估多个结构化问题,而不是逐个标记地写答案。 TypSafe报告70- 500 ms响应,性能比同类LLM快40- 200倍
1.7万 views · 144 likes · 63 saves
Mnimiy
@Mnilax
ChatGPT的共同发明者刚刚推出了一款模型,该模型只需0.114秒即可完成GPT Astra在8.5中的功能。 我将Jev连接到我在Astra上运行的构建的路由层:同样的任务很快在37分钟内完成,重新尝试的错误响应为零。 您向它提交一个情况和一份打印问题列表。 它同时并行回答所有问题,并为每个问题附加一个置信度。 没有思想链,没有代币一一流出。 您停止将一个SON blob解析回您的代码中并祈祷它能够验证,因为模型物理上无法在您定义的选项之外进行回答。 TypSafe为其发布的数字: 每百万个输入代币> 0.042美元,输出代币免费 >与Sonnet 5相同的准确性,两者均为67.8%,成本降低294倍,速度提高195倍 > 0.114秒对8.566 GPT-5.6 Terra在同一演示 他们的Doom演示让它每秒做出大约10个决定 由DCVC牵头的4000万美元种子基金,这个名字是对杰文斯的致敬,杰文斯是一位经济学家,他表明更便宜的煤炭意味着燃烧更多的煤炭,而不是更少。 这在代理下面运行,在每秒发生10次的呼叫上,从来没有人读过。 API的等待列表,但浏览器游乐场现在已经开放。下面的链接。
2.0k views · 37 likes · 23 saves
GeniusThinking
@GeniusGTX
贾维斯终于来了吗? TypSafe刚刚推出了Jev,这是一个结构化决策API,可以路由模型、对搜索结果进行排名并检查其他人工智能系统,而无需聊天机器人参与循环。 想象一下一个真正有效的Magic 8球:一个输入答案,带有赔率和信心分数。 这意味着他们可以: ·模型路由:将每个请求发送到正确的模式 · LLM输出检查:在用户看到弱答案之前标记弱答案进行审查 ·支持工作流程:对门票进行排序并决定自动化或升级哪些门票 刚刚实现的TypSafe报告延迟约为150 ms,成本比LLM低约100倍,响应速度更快。 早期API访问等待列表在下面打开。
7.0k views · 3 likes · 4 saves
@TheINAOG
@TheINAOG
最后我访问了@typesafeai(谢谢你们!) Jev +模拟器前瞻性清除《超级马里奥兄弟》1-1仅需0.04美元。 在这个设置中,Jev看不到像素:我将RAM解析为结构化状态、模拟控制器宏、过滤预测死亡,然后让Jev选择。已记录运行; API中断后从同一状态恢复。 权衡:RAM提供精确、可审计的观察,但我的适配器是特定于游戏的。回避视觉使这个实验变得更容易;它不能解决一般游戏代理的感知问题。 Jev的潜力是作为结构化观察和预测结果的战术决策层。 警告:1-1对于RAM +搜索很容易。接下来:Jev与相同模拟上的廉价启发式。该模型真的赢得了自己的地位吗?
296 views · 2 likes · 1 saves
数据快照2026年9月19日
来源QMuse archive ↗ · 202 X posts
整理方法保留公开帖子的作者署名与原始链接;分类是本站编辑标签。本页独立、非官方,帖子与媒体版权归原作者所有,互动指标仅为采集时快照。