不聊天的决策模型,可能是智能体落地的下一块拼图
最近几天,AI 圈被一个"哑巴模型"刷屏了——它叫 Jev,不聊天、不写文章、不写代码,只做一件事:判断。
说实话,我第一次看到也愣了一下。我们习惯了"AI 就是会说话的大模型"这个直觉,突然来个"不说话的模型",还火成这样,总得想想它为什么能火。但等我看完它的定位和几个实测,我的判断是:这大概率不是炒作,而是智能体落地少了一块关键拼图。
(判断基于 2026-09-24 前后的信息;决策模型赛道刚起,迭代很快,文中部分结论需要持续验证。)
Jev 是什么:一个"系统一"决策模型
Jev 由前 OpenAI 研究员、ChatGPT / RLHF 共同发明人 Diogo Almeida 创办的 TypeSafe AI 在 9 月 15 日发布。官方把它归入一个新品类:System One(系统一)模型——名字取自卡尼曼《思考,快与慢》。
它的核心差异在于:不逐 token 生成文本,而是直接返回带概率的结构化判断。 你给它一段业务状态 + 一组带类型的问题,它一次往返全部评估完,返回结构化的答案。
它有三种原语:
| 原语 | 作用 | 返回形式 | 典型场景 |
|---|---|---|---|
| Choice | 从最多 255 个候选项里选一个 | 选中项 + 完整概率分布 + 置信度 | 工单路由到账单/技术/销售团队 |
| Score | 在 2–10 级有序量表上打分 | 分数(可落两档之间)+ 置信度 | 评估客户情绪从"平静"到"非常愤怒" |
| Noul | 判断一个命题是否成立 | 0–1 的概率 | "这封邮件需要立即处理吗" |
一句话理解:它像是一个"带概率的语义 if-else 门"。 你定义好问题、给出候选项,它做判断、给概率,中间不输出任何废话。

为什么突然爆火:快、便宜、还是新品类
火成这样不是没原因的,三个点叠在一起:
- 快:官方口径是"比前沿大模型分类任务最快提速近 200 倍",接口响应大致在几十到几百毫秒级(多方实测不一)。
- 便宜:输出 token 永久免费,输入按量计费,成本比通用大模型低约两个数量级。
- 新品类:它颠覆了"AI = 会说话"的直觉。发布当天在 Hacker News 拿到 1679 分、四百多条评论,第二天 Vercel AI Gateway 就接入,Cloudflare 也跟进了。
一个不说话的模型能引来这么多关注,本身就是个信号——市场在找"大模型之外的东西",而它正好踩在了这个点上。
我用我的尺子最关心的一点:它对 Agent 是刚需
这才是真正有意思的地方,也是我觉得它火得合理的原因。
Agent 干活的时候,表面上是"思考 + 说话",其实大量时间在做判断:该不该调这个工具、走哪条分支、这个结果可信吗、要不要转人工、要不要重试。而且一个任务往往要连续做几十次这样的判断。
现在这些判断几乎全是用大模型"逐 token 生成"来做的——让一个只会写文章的大模型去扮演 if-else 函数。结果就是:延迟高、成本高、错误还随步骤数累积。你跑一个 Agent,光内部判断这一层就吃掉一大块 token 和响应时间。
Jev 这类决策模型恰好卡在这个位置:把高频、低容错的判断从大模型身上卸下来,交给又快又便宜的"判断专用模型"。 对 Agent 工程来说,这不是锦上添花,是实打实的降本增效点。
简单说:让会说话的模型去说话,让会判断的模型去判断。 各干各擅长的,Agent 才跑得起来、跑得便宜。
要泼盆冷水(清醒一点)
火归火,我有几个实在的提醒,别一上来就上头:
- 护城河可能很浅:发布才三天,社区就开源出同类模型 LAYA(GitHub 上线三天就超 4000 星,本地可跑、t4 上单问几十毫秒)。某 2000 题基准上 LAYA 报 76.6%、Jev 报 72.7%。这种"判断能力"壁垒不高,闭源的优势可能撑不了太久——从你一直看的开源趋势看,这点要留心。
- 适用范围窄:它只做"给定候选的判断",不做开放推理、不写代码。它不是替代大模型,是跟大模型分工——用错了地方就是浪费。
- 准确率还得实测:判断模型的边界、幻觉、领域泛化,不能只看 benchmark。真实业务数据跑出来的数,才算数。
落到你的赛道上
结合你一直在做的垂直行业智能体的"最后一公里"落地,我的判断很明确:
企业"第一不敢用、第二不知道怎么用"智能体,很大一部分原因是成本压不下来、响应不够快。Jev 这类决策模型,正好把 Agent 里最高频的那部分判断(合规校验、路由、打分、质量门槛、是否转人工)成本降一个量级——企业才敢用、才用得起。
所以它很可能不是又一个刷屏的噱头,而是 Agent 从 demo 走向生产级落地的一块关键拼图。接下来值得重点盯的,一是 Jev 在真实业务里的准确率验证,二是开源版 LAYA 会不会把这条赛道变成"能力免费、拼工程落地"的格局——真到那一步,拼的就是谁更能把决策模型接进业务、调出效果,这恰恰是工程和落地的活儿。
最后
一个不聊天的模型刷屏,很多人当热闹看。但对我来说,它像是一个信号:AI 正在从"陪人说话"走向"替人做事",而做事免不了大量判断。
判断这个环节,过去被大模型顺手干了,既不快也不便宜。现在有人专门做这件事了——这很可能就是智能体真正落地的那块拼图。
想跟进智能体落地的朋友,这个方向值得盯着。