Skip to content

不聊天的决策模型,可能是智能体落地的下一块拼图 ​

最近几天,AI 圈被一个"哑巴模型"刷屏了——它叫 Jev,不聊天、不写文章、不写代码,只做一件事:判断。

说实话,我第一次看到也愣了一下。我们习惯了"AI 就是会说话的大模型"这个直觉,突然来个"不说话的模型",还火成这样,总得想想它为什么能火。但等我看完它的定位和几个实测,我的判断是:这大概率不是炒作,而是智能体落地少了一块关键拼图。

(判断基于 2026-09-24 前后的信息;决策模型赛道刚起,迭代很快,文中部分结论需要持续验证。)

Jev 是什么:一个"系统一"决策模型 ​

Jev 由前 OpenAI 研究员、ChatGPT / RLHF 共同发明人 Diogo Almeida 创办的 TypeSafe AI 在 9 月 15 日发布。官方把它归入一个新品类:System One(系统一)模型——名字取自卡尼曼《思考,快与慢》。

它的核心差异在于:不逐 token 生成文本,而是直接返回带概率的结构化判断。 你给它一段业务状态 + 一组带类型的问题,它一次往返全部评估完,返回结构化的答案。

它有三种原语:

原语作用返回形式典型场景
Choice从最多 255 个候选项里选一个选中项 + 完整概率分布 + 置信度工单路由到账单/技术/销售团队
Score在 2–10 级有序量表上打分分数(可落两档之间)+ 置信度评估客户情绪从"平静"到"非常愤怒"
Noul判断一个命题是否成立0–1 的概率"这封邮件需要立即处理吗"

一句话理解:它像是一个"带概率的语义 if-else 门"。 你定义好问题、给出候选项,它做判断、给概率,中间不输出任何废话。

Jev 决策模型工作原理

为什么突然爆火:快、便宜、还是新品类 ​

火成这样不是没原因的,三个点叠在一起:

  • 快:官方口径是"比前沿大模型分类任务最快提速近 200 倍",接口响应大致在几十到几百毫秒级(多方实测不一)。
  • 便宜:输出 token 永久免费,输入按量计费,成本比通用大模型低约两个数量级。
  • 新品类:它颠覆了"AI = 会说话"的直觉。发布当天在 Hacker News 拿到 1679 分、四百多条评论,第二天 Vercel AI Gateway 就接入,Cloudflare 也跟进了。

一个不说话的模型能引来这么多关注,本身就是个信号——市场在找"大模型之外的东西",而它正好踩在了这个点上。

我用我的尺子最关心的一点:它对 Agent 是刚需 ​

这才是真正有意思的地方,也是我觉得它火得合理的原因。

Agent 干活的时候,表面上是"思考 + 说话",其实大量时间在做判断:该不该调这个工具、走哪条分支、这个结果可信吗、要不要转人工、要不要重试。而且一个任务往往要连续做几十次这样的判断。

现在这些判断几乎全是用大模型"逐 token 生成"来做的——让一个只会写文章的大模型去扮演 if-else 函数。结果就是:延迟高、成本高、错误还随步骤数累积。你跑一个 Agent,光内部判断这一层就吃掉一大块 token 和响应时间。

Jev 这类决策模型恰好卡在这个位置:把高频、低容错的判断从大模型身上卸下来,交给又快又便宜的"判断专用模型"。 对 Agent 工程来说,这不是锦上添花,是实打实的降本增效点。

简单说:让会说话的模型去说话,让会判断的模型去判断。 各干各擅长的,Agent 才跑得起来、跑得便宜。

要泼盆冷水(清醒一点) ​

火归火,我有几个实在的提醒,别一上来就上头:

  • 护城河可能很浅:发布才三天,社区就开源出同类模型 LAYA(GitHub 上线三天就超 4000 星,本地可跑、t4 上单问几十毫秒)。某 2000 题基准上 LAYA 报 76.6%、Jev 报 72.7%。这种"判断能力"壁垒不高,闭源的优势可能撑不了太久——从你一直看的开源趋势看,这点要留心。
  • 适用范围窄:它只做"给定候选的判断",不做开放推理、不写代码。它不是替代大模型,是跟大模型分工——用错了地方就是浪费。
  • 准确率还得实测:判断模型的边界、幻觉、领域泛化,不能只看 benchmark。真实业务数据跑出来的数,才算数。

落到你的赛道上 ​

结合你一直在做的垂直行业智能体的"最后一公里"落地,我的判断很明确:

企业"第一不敢用、第二不知道怎么用"智能体,很大一部分原因是成本压不下来、响应不够快。Jev 这类决策模型,正好把 Agent 里最高频的那部分判断(合规校验、路由、打分、质量门槛、是否转人工)成本降一个量级——企业才敢用、才用得起。

所以它很可能不是又一个刷屏的噱头,而是 Agent 从 demo 走向生产级落地的一块关键拼图。接下来值得重点盯的,一是 Jev 在真实业务里的准确率验证,二是开源版 LAYA 会不会把这条赛道变成"能力免费、拼工程落地"的格局——真到那一步,拼的就是谁更能把决策模型接进业务、调出效果,这恰恰是工程和落地的活儿。

最后 ​

一个不聊天的模型刷屏,很多人当热闹看。但对我来说,它像是一个信号:AI 正在从"陪人说话"走向"替人做事",而做事免不了大量判断。

判断这个环节,过去被大模型顺手干了,既不快也不便宜。现在有人专门做这件事了——这很可能就是智能体真正落地的那块拼图。

想跟进智能体落地的朋友,这个方向值得盯着。

📖本文阅读--次|📊全站访问--次|👥访客--人