hermes-ai.net

查看文档 →
HermesHermes Agent 中文文档
← 返回案例库
Case / 2100411066966749359研究
案例媒体 / 1MP4 ↗

Gregor Zunic

@gregpr07
已认证

中文参考

突破:浏览器使用+ Jev =超快收件箱 发现航班需要7秒,只需0.0039美元 >每一步都有新的行动空间 >多姆状态空间 >LLM小型回退到类型 (this视频速度为1倍(顺便说一句) 构建了一个小型开源浏览器代理。在下面尝试一下#https://t.co/AplCBRYC5o

原帖全文 / EN

Breaking: Browser Use + Jev = Ultrafast ⚡ Findings flights took 7s and cost only $0.0039 🤯 > new action space every step > DOM state space > small LLM fallback to type (this video is at 1x speed btw) Built a tiny open source browser agent. try it below ↓ https://t.co/AplCBRYC5o
浏览
248.9万
点赞
8242
收藏
8934
转发
572
查看 X 原帖 ↗

转载与衍生

梭哈.AI @SUOHA_AI

Browser Use 接上 JEV 这速度太他妈吓人了吧?? 过去大家看 GPT、Claude 操控浏览器,体验其实并不好,因为真的太慢了,中间还经常卡死... 因为让大模型写一堆长篇大论去操作网页,本质上就是杀鸡用牛刀 在网页上点按钮,本质上就是一个离散的多选题,根本不需要 AI 会写诗 JEV 拿到 DOM 结构,以做分类题的速度毫秒级选出该点的元素,只有在需要打字输入时才偶尔回退给小模型 黑客松冠军开发者 @gregpr07 刚刚拿 JEV 做了个开源的微型浏览器 Agent,让它自主打开网页查机票 整个过程: • 耗时仅仅 7 秒 • 成本只要 $0.0039(折合人民币不到 3 分钱) • 作者特意注明:演示视频是 1 倍速,没有任何加速剪辑 这个老哥还开源了GitHub: https://t.co/e9tXcYPIzC

AYi @AYi_AInotes

喵的,开源社区有点过于凶猛了!!! 拥有 4.5 万星的 Browser Use 创始人 Gregor Zunic 刚刚发了段实测视频, 直接把整个浏览器自动化(Browser Agent)行业的桌子给掀飞了: 查一次真实的航班机票,从打开网页、输入筛选到返回结果, 全程只花了 7 秒钟!单次成本只要 0.0039 美元(折合人民币不到 3 分钱)! 最让人头皮发麻的是,视频右下角清清楚楚标着:这是 1 倍原速,毫无快进。 很多人以为这又是哪个团队在做加速特效博眼球, 但你仔细看他接入的底层引擎,你会发现昨天那个被争议包围的神秘新模型 Jev(ChatGPT 共同发明人刚发布的无文本模型), 今天直接在真实的浏览器环境里,交出了让全行业目瞪口呆的答卷。 这篇开源测试背后,藏着网页智能体彻底告别“又慢又贵”的最深刻的一次工程跃迁: 从过去“等大模型慢吞吞思考几十秒” $\to$ 跨越到了“毫秒级点击跳转的确定性闪电战”! 看懂他现场跑通的三层硬核设计,你会明白为什么传统的网页 Agent 正在被降维打击: 1️⃣ 第一层:把动作空间打碎,不看截图直接秒切: 过去的浏览器 AI 笨重得像个树懒——每走一步就要截一张图、把几万行 DOM 树塞给大模型慢吞吞地看,查个机票要两分钟; 这里直接改成了动态动作空间(Dynamic Action Space): 大模型直接面对 DOM 状态做毫秒级映射,每一步只计算当前网页可操作的极小范围,速度直接飙到肉眼看不清; 2️⃣ 第二层:成本砍掉 450 倍的秘密——输出 Token 彻底免单: 这就是接入 Jev 最恐怖的地方! 传统的 Agent 每点一个按钮,都要逼着大模型在后台吐几百个 Token 的思考过程,费用高到没人敢商用; 而 Jev 根本不会写自然语言,它只输出底层的结构化概率与决策,输出 Token 在物理层面上直接免费! 整套订票流程走完,账单居然只有惊人的 0.0039 美元; 3️⃣ 最狠的第三层:大小模型混合借力(Fallback 机制): 有人会问:Jev 既然一个字都不会写,那怎么在网页搜索框里输入机场和人名? Gregor 给出了绝妙的解法—— 99% 的页面跳转、点击按钮、选择日期、多分支判断,全由极速的 Jev 瞬间完成; 只有在真正需要敲键盘输入文字的一瞬间,才临时唤醒一个小模型去打字! 主力管极速冲锋,轻骑兵管文字输入,整条链路没有一毫秒的算力浪费。 昨天全网还在质疑“一个连文本都不会生成的大模型到底能有什么用”, 今天开源社区就用一份不到 3 分钱的真实机票账本,给所有怀疑者结结实实上了一课。 大模型的未来,从来不是在聊天框里陪人类写诗闲聊; 把废话全部剔除, 用这种快到不可思议的执行力,在真实网页里替你把脏活秒级干完, 这才是让 Agent 从玩具真正走向亿万人日常的终极形态。 小型的开源 Agent 已经扔到了 GitHub,建议所有做网页自动化和出海爬虫的朋友,赶紧去把这套代码拉下来跑一遍。 https://t.co/yK8FKepIdT

SuSu_酥酥👅 @NFT_Chen

🤯难以置信!Jev × Browser Use把浏览器速度打到变态快! 实测案例:给一句目标「苏黎世→伦敦,9月20日单程经济舱」,Agent 自己打开 Google Flights,切单程、填城市、选日期、点搜索。全程 1 倍速,含打字和页面加载。 亮眼表现: 🔹7.1 秒出结果
🔹成本仅 $0.0039
🔹协议调用 1092 → 101,砍 91%
🔹中位耗时再降 25%
🔹决策约 178ms,5.2 秒已点搜索
🔹大模型只在打字时出场,不靠截图开车 每步重建索引动作空间:点谁、打什么、等不等,一次请求定,开源可跑! 具体查看:https://t.co/2mZfZ0FLwb #Jev #BrowserUse #AIAgent #BrowserAgent #OpenSource https://t.co/2WVDUfNg1P https://t.co/xkJ46MNzD5

Jurly @jurlycat

Jev是当你停止强迫人工智能说话时会发生的事情。 ​ 这是TypSafe AI的第一个公共“System One”模型,旨在在软件(而不是对话)中快速决策。 ​ 你给它: ​ ·非结构化状态:文本、日志、票据、文档 ·预定义的模式:问题和允许的答案 ​ Jev不是逐个生成令牌,而是并行评估选择并返回具有概率分布的类型化值: ​ 计费:92% 技术:6% 销售额:2% 紧急:87% ​ TypSafe使用RLCD训练它:校准决策的强化学习。目标不是更好的散文,而是那些自信反映出它们正确可能性的决定。 ​ 没有自由形式的文本意味着没有格式错误的SON、虚构的字段或解析再试。 ​ 在随附的演示中,浏览器代理使用Jev实时选择每个操作和目标,在7.1秒内找到苏黎世-伦敦的航班。 ​ LLM生成计划。Jev可以成为每个软件循环中运行的决策引擎。

opcodee @opc0de3

两天前,一个人运送了一个无法写文本的模型。昨天有人将其插入浏览器,搜索航班,搜索十分之四美分 每个任务0.0039美元。七秒。他自己这么说,视频速度是1倍 浏览器使用的运营商Gregor Zunic在Jev推出后的第二天就将他的浏览器代理连接到了Jev。一夜之间有854,000人观看了该视频 他实际建造了什么: - 每一步都计算一个新的动作空间,而不是一个固定的工具箱 |将页面多姆作为状态移交,而不是作为视觉模型斜视的屏幕截图 - 保留一个小型LLM,仅在必须输入某些内容时使用 →整个内容在麻省理工学院下开源,第一天就有811颗星 为什么十分之四美分比七秒重要 如今,每个浏览器代理都需要支付一个前沿模型来回答一个几乎从来都不是问题的问题。点击这个或那个。页面已加载。这九个按钮中哪一个是搜索框这是一个决定,不是一篇论文,你一直在买论文, 当决策层的成本为每十亿个令牌42美元,并且输出是免费的时,代理步骤的成本不再是限制您运行多少步骤的因素 这就是整个解锁。而不是更聪明的特工。可以犯两次错误的代理人 他回答中的怀疑论者提出了正确的问题:旧堆栈拿走了什么。他还没有并排发布,在他这样做之前,只是一次航班搜索的演示 但方向并不模糊。在两天前的模型上建造的人们比争论它是否算作模型的人们行动得更快 https://t.co/VTBwkO8gtW 剪辑是他的,以真实的速度奔跑

来源

本页为独立社区整理,仅展示公开原帖与来源链接。媒体、文本、账号信息及商标权利归原作者和原平台所有。