扫码分享到微信
一个"哑巴模型"创下了史上最快采用纪录
9月15日,一个叫Jev的新模型在硅谷悄然发布。
没有铺天盖地的PR,没有CEO上台的发布会,甚至连一篇正经的博客长文都没有——创始人Diogo Almeida只是在X上连发了几条帖子,然后就炸了。
24小时后,Vercel AI Gateway的数据出来了:近13%的付费团队已经在使用Jev,是之前所有新模型上线首日的两倍以上,是Claude Fable 5.1的6倍。它上线12小时就超过了所有竞品,然后差距越拉越大。
36小时内,14万名开发者涌入内测。Vercel接了,LangChain接了,Cloudflare接了——几乎你能叫得出名字的AI基础设施平台,全都在第一时间把它集成进去了。
有意思的是,这个创下史上最快采用纪录的AI模型,它不会说话。
它不能写文章,不能写代码,不能陪你聊天,甚至连一句完整的话都生成不出来。你给它输入一段文字,它只会回给你几个数字和标签——比如"96%紧急"、"分类:账单问题"、"愤怒程度:3.0/4"。
听起来像个高级版分类器?如果只是这样,它不可能火成这样。
Jev的真正意义,藏在一个很多人还没意识到的地方——AI正在经历一次物种分化。
Jev到底是什么
先别急着上升到范式。让我们先搞清楚,这个"不会说话的AI"到底是怎么工作的。
三个原语,就是它的全部
Jev的API简单到令人发指——只有三种问题类型:
Choice:从一组选项里挑一个。比如"这封客服邮件该转给哪个部门?",它返回每个选项的概率分布和最终选择
Score:在一个自定义的等级尺度上打分。比如"客户愤怒程度:1=平静,2=有点烦,3=很生气,4=要跑路",它返回一个连续值
Noul:是非判断题,返回一个0到1之间的概率值
就这三种。没有生成,没有解释,没有推理链。
你可能会说:这不就是分类器吗?十年前就有了。
区别在于——以前的分类器,你每换一个分类任务,就得重新标注数据、重新训练模型。而Jev跟大模型一样,具备零样本泛化能力。你告诉它分类标准是什么,它立刻就能判断,不需要微调。
换句话说,它保留了大模型的语义理解能力,但砍掉了生成文本的能力。
为什么能这么快这么便宜
砍掉生成能力不是随便砍的——它改变了整个推理过程。
普通大模型是自回归的:一个token一个token往外蹦,生成100个token就要跑100次前向计算。输出越长,越慢越贵。
Jev不走这条路。它的输出空间是预先定义好的——选项就那么多,答案就是一个概率值。所以它可以并行采样,一次前向计算全部搞定。
官方公布的数据是:
延迟:70-500毫秒端到端(大模型通常是3-329秒)
价格:输入每百万token 0.042美元,输出免费
官方benchmark上比前沿大模型最快194倍、最便宜445倍
输出免费的底气也在这里——既然没有逐字生成的过程,那就没有值得计费的输出。博客里原话很嚣张:"便宜到根本不值得计费"。
支撑这一切的是RLCD
训练方法上,Jev用的不是RLHF,是RLCD——Reinforcement Learning for Calibrated Decisions(校准决策强化学习)。
RLHF奖励的是"人类看了觉得好";RLCD奖励的是"你说的概率,得和你的实际命中率对上"。模型说自己有90%把握,那就得真有90%的时候是对的。
这个校准很重要。因为如果置信度是靠谱的,程序就可以根据置信度来做决策——比如80%以上置信度的自动处理,50%-80%的转人工复核,50%以下的升级处理。
但这里必须泼一盆冷水:Jev的判断力并没有碾压同级模型。
虎嗅做了一组中文客服场景的实测,50道题,Jev的完整准确率约64%-65%,在便宜小模型组里只排第二,比DeepSeek V4 Flash还低1.2分。放到更强的模型组里,差距就更明显了——MiniMax M3能拿38分,比Jev多做对约5.4题。
它的优势从来不是"更准",而是"够准但快得多、便宜得多"。
这就够了。因为很多场景,你不需要95分的判断,你只需要60分的判断——但你需要每秒做一万次。
它真正的位置在Agent的身体里
如果只把Jev当成"更快更便宜的分类器",你就看浅了。
要理解Jev为什么爆火,你得先理解一个问题:Agent里面,大模型到底在干什么?
Agent的绝大多数调用,根本不需要说话
一个典型的Agent工作流大概是这样的:
用户给一个任务 → 大模型规划第一步 → 调用工具 → 拿到结果 → 大模型判断下一步该干嘛 → 再调用工具 → 再判断 → …… → 完成。
注意到了吗?在这个循环里,"判断下一步干嘛"这个环节,接收方是程序,不是人。程序根本不需要大模型写一段"根据当前状态,我认为下一步应该调用搜索工具"的漂亮话——它只需要知道"调用哪个工具"这一个答案。
但现在的做法是,每一步都要调用一次完整的大模型,让它生成一段文字,然后程序再去解析这段文字。
这有多浪费?
想象一下:你让助理帮你订机票,助理每次做一个决定之前,都要先把理由写成一篇200字的小作文念给你听——但你根本不想听理由,你只想知道结果。
这就是今天Agent的现状。每跳一步都要花几秒钟、花几美分,让大模型生成一段最终会被程序parse掉、人类永远不会读到的文字。
Jev干的,就是把这部分"给程序看的判断"从大模型里剥离出来。
双核架构:大模型动脑,Jev动手
官方的定位很明确——Jev和大模型不是替代关系,是**"双核搭档"**。
大模型负责什么?负责复杂推理、内容生成、开放式规划——也就是卡尼曼说的"系统二":慢、费脑、但能解决复杂问题。
Jev负责什么?负责分类、路由、打分、校验、风险判断——也就是"系统一":快、直觉、几乎不费脑子。
一个真实的Agent工作流可能变成这样:
大模型拿到任务,做整体规划(系统二,慢但聪明)
执行过程中,每一步该调用哪个工具、该不该重试、结果合不合格——全交给Jev(系统一,快且便宜)
遇到Jev拿不准的(低置信度),再回调大模型(系统二介入)
最后,大模型生成给用户看的结果(系统二产出)
这个架构变化,意味着什么?
意味着Agent的成本可能会降一个数量级。以前跑一个复杂任务要调用十次大模型,现在可能只需要调用两次——其余八次全用Jev,成本几乎可以忽略不计。
LangChain已经把这个模式做成了AutoModeMiddleware,Vercel直接把它放进了fx auto模式里当安全审查。有人用它做浏览器Agent,查机票7秒完成,成本0.0039美元——这在以前是不可想象的。
Harness正在变成新的中枢
顺着这个逻辑再往下走一步,你会发现一个更重要的变化:
Agent系统里最值钱的部分,可能不再是大模型,而是Harness(调度层)。
Harness是什么?就是那个决定"什么时候调用什么模型、置信度多高自动放行、什么情况升级处理"的调度逻辑层。以前它很薄,因为只有一种模型可用,调度很简单。
但当你手上有了大模型(系统二)、决策模型(系统一)、还有各种不同尺寸不同价格的中间模型——Harness就变成了整个系统的大脑。它决定了你的Agent是快还是慢、是贵还是便宜、是可靠还是容易出问题。
这才是Jev真正的冲击:它不是又多了一个模型选项,它逼着整个行业重新思考Agent的架构。以前大家都在卷"怎么让大模型更聪明",现在开始有人问——我们真的需要每一步都用最聪明的模型吗?
AI正在经历物种分化
讲到这里,我们可以往上走一层了。
Jev为什么叫Jev?这个名字取自19世纪的经济学家威廉·杰文斯(William Stanley Jevons),对应"杰文斯悖论":当一种资源的使用效率提升、成本下降,最终对它的需求反而会上升,而不是下降。
最经典的例子是瓦特改良蒸汽机——蒸汽机效率提高了,按理应该用更少的煤,但结果是煤炭的消耗量暴涨,因为更便宜的动力催生了更多的应用场景。
TypeSafe用这个名字,野心不小。他们赌的是:当决策的成本降到接近零,决策的用量会爆炸——以前你不舍得让AI判断的每一件小事,以后你都会让AI判断一遍。
但我觉得,这个名字背后藏着一个更深刻的变化,他们自己可能都没完全说透:
AI正在从"全能型"走向"分化型"。
从单细胞到多细胞
想一想生命的演化。最早的生命都是单细胞生物,一个细胞什么都干——进食、消化、呼吸、繁殖,全包了。
然后发生了什么?多细胞生物出现了。细胞开始分化:有的变成神经细胞,专门负责信号处理;有的变成肌肉细胞,专门负责运动;有的变成上皮细胞,专门负责保护。
分化之后,效率才真正上去了。因为每个细胞只干一件事,可以干到极致。
AI现在就在经历这个过程。
过去几年,整个行业都在追"通用大模型"——一个模型什么都能干:聊天、写代码、画画、做推理、翻译、写邮件……全能,但也全贵、全慢。
Jev的出现,标志着分化的开始。它不是一个"更差的大模型",它是一个全新的物种——决策模型。它不跟大模型抢"谁更聪明"的赛道,它开辟了"谁更适合给软件用"的新赛道。
这不是第一次分化了。多模态模型已经在分化(专门做视频的、专门做图像的),代码模型也在分化(专门写代码的),但那些都是"生成能力的垂直分化"——本质上还是生成式模型,只是更擅长某个领域。
Jev的分化是更底层的:它连生成能力都放弃了。它从"生成模型"这个物种里彻底跳了出来,变成了"决策模型"。
系统一和系统二的分离
这正好对应了卡尼曼在《思考,快与慢》里提出的双系统理论——人类的思维有两个系统:
系统一:快速、自动、直觉式的判断。比如看到一张愤怒的脸立刻知道对方在生气,比如开车时的下意识反应,比如1+1等于几。几乎不费脑力。
系统二:缓慢、审慎、需要专注思考。比如解一道复杂的数学题,比如做一个重要决策,比如写一篇文章。需要集中注意力,消耗大量脑力。
人类的大脑是怎么工作的?绝大多数时候用系统一,只有系统一搞不定的时候,系统二才会介入。
你不会每次过马路都用系统二去计算车速和距离——你用系统一对距离做个直觉判断就够了。只有当情况复杂的时候(比如下雨天、晚上、路口混乱),你才会启动系统二,仔细观察、认真判断。
这就是效率最高的模式。
但今天的AI是什么模式?每一次都调用系统二——不管多简单的问题,都让大模型从头到尾"认真思考"一遍。
这不是AI该有的样子。这是用法拉利跑滴滴。
Jev干的,就是把AI的"系统一"给拆出来了。
你可以把它理解为:AI终于长出了"直觉"。
杰文斯悖论:当决策变成免费的
我们再回到Jev这个名字背后的经济学悖论。
如果Jev代表的方向成立——决策模型足够便宜、足够快、足够好用——会发生什么?
不是"同样的决策更便宜了"。
而是——决策的数量会爆炸。
今天,一个电商网站可能只会对订单做一次风控判断。为什么只做一次?因为每判断一次都要调用大模型,花钱。
如果判断几乎免费呢?你可能会在每一个环节都做判断:用户注册的时候判断一次,浏览商品的时候判断一次,加购物车的时候判断一次,下单的时候判断一次,支付的时候再判断一次。你还可以对每一条评论做实时审核,对每一次客服对话做情绪跟踪,对每一个搜索结果做相关性校验。
以前因为成本原因,很多该做判断的地方你没做。现在成本趋近于零,你就全做了。
这就是杰文斯悖论:效率提升不会减少资源消耗,反而会因为新应用场景的涌现而大幅增加消耗。
对AI行业来说,这意味着什么?
意味着总调用量可能会涨十倍、百倍。大多数调用不是给人看的,是给软件用的。人类每天产生的AI交互次数是有限的,但软件内部的决策次数——理论上可以无限多。
这可能才是Jev真正的赌注:不是抢大模型的蛋糕,是把整个AI市场的蛋糕做大100倍。
它不是银弹
吹了这么多,必须冷静下来。
Jev不是什么革命性的AGI突破,它也有非常明确的边界。
判断力没那么神
前面已经提过了,实测中Jev的准确率并没有超过同级别的小模型。它的核心优势是速度和成本,不是准确度。
对于那些"判断错了后果很严重"的场景,你还是得用更强的模型。或者用Jev做初筛,把高置信度的放过去,低置信度的交给大模型复核——这其实也是它最适合的定位。
不能做开放式推理
Jev只能在你给定的选项里做选择。如果问题本身没有明确答案,如果需要创造性思考,如果需要一步步推理——它完全不行。
它的数学推理能力顶多GPT-4水平。它不能生成代码。它不能写文案。它不能做任何需要"创造"的事情。
它是一个非常专精的工具,不是万能钥匙。
技术门槛可能没那么高
Jev发布才几天,APUS就宣布做出了开源复现版本——用Qwen3.5-9B本地模型,通过跳过自回归解码、直接用logits打分的方式,实现了类似的效果。
如果"决策模型"本质上就是"去掉自回归头的小模型+并行打分+校准训练",那这个技术壁垒可能没有想象中高。开源社区很快会跟进,各大云厂商也会迅速推出类似产品。
它可能不会成为下一个OpenAI,而更像是——验证了一个方向,然后整个行业一窝蜂冲进来,把它变成标配。
"零幻觉"是偷换概念
官方宣传的"零幻觉",指的是输出格式上的零幻觉——它不会生成一个不在选项里的答案,不会返回格式错误的数据。
但判断本身可能是错的。它只是不会选D,但可能在A、B、C里选错。
这一点必须说清楚。很多人看到"零幻觉"就以为它不会犯错,这是误解。
分裂才刚刚开始
Jev的爆火,不是因为它有多强,而是因为它戳中了整个行业的一个隐秘痛点:
我们用大模型做了太多大材小用的事。
过去三年,所有人都在追"更大的模型、更强的能力"——就像早期的生物,都在拼谁的细胞更大、谁的功能更全。
但现在,有人走了另一条路:不追更大,追更专;不追全能,追分化。
这条路对不对?现在下结论还太早。也许Jev只是昙花一现,也许决策模型这个赛道会迅速挤满玩家,也许最后大模型把这个功能也给吞并了。
但有一件事我倾向于认为是对的:
AI的未来,不会是一个无所不能的超级大脑。它会是一个系统——很多个不同的模型,各有分工,各司其职,快的负责快的事,聪明的负责聪明的事,便宜的负责量大的事。
就像人体不是一个巨大的单细胞,而是由无数个分化的细胞组成的协作系统。
Jev只是分化的第一步。接下来还会有什么?专门做记忆的模型?专门做规划的模型?专门做验证的模型?
不知道。但方向好像越来越清晰了。
两年前,Diogo Almeida离开OpenAI的时候,他问了自己一个问题:既然大模型已经这么强了,为什么大多数工作还没有被自动化?
Jev是他给出的第一个答案。(文/王子祺)
京ICP证000080(一)-16
京公网安备11010802009845号
北京赛迪网信息技术有限公司