最近,一个新模型在开发者圈子中备受关注,名为Jev。相关帖子浏览量已超过3700万,Hacker News上有关它的讨论层出不穷。Jev的火热之处在于它独特的功能,它并不进行聊天或代码生成,而是主要负责决策,通过输出选择和相应的概率来帮助用户。这一改变使得传统大型语言模型(LLM)的生成功能得以简化,转向专注于判断。Jev的性能也十分优秀,速度最快可达193.6倍,且成本降低至444.6倍,输入每百万Token仅需0.042美元,实现输出token永久免费。这让许多现有的Flash模型黯然失色。
这款模型的创始人是OpenAI的前研究员Diogo Almeida,他曾参与RLHF和InstructGPT等核心项目。Almeida在教导AI如何良好表达后,选择了直接创建这样一个让AI“闭嘴”的模型。Jev是他建立的新公司TypeSafe AI首次亮相的产品。根据官方介绍,Jev被称为System One Model,这一概念来源于心理学家丹尼尔·卡尼曼的双系统理论,系统1强调快速直觉决策,而系统2则偏向于缓慢的逻辑推理。当前的LLM多沿着系统2发展,而Jev则致力于系统1的探索。
Jev得名于Jevons悖论,象征着单一任务成本的显著降低,以及AI使用量的潜在快速增长。Jev具有三种核心能力:Choice(选择)、Score(评分)和Noul(概率判断)。简单来说,Jev可以被理解为带有概率评估的“语义逻辑门”,它分析非结构化输入和约定的问题类型,输出决策和评分,随后交由其他程序继续处理。
有些人可能会疑惑,传统的生成模型是否也具备分类能力?答案是肯定的,但它们的答案生成方式有所不同。传统生成模型通常逐字生成答案,即便最后只需输出一个“A”,也会消耗大量Token进行解释。而Jev则能直接给出判断结果,并能够并行处理输入中的多个问题,节省了逐字生成的时间和成本,从而大幅提升了处理速度和费用效益。官方数据显示,Jev的端到端响应时间低至70到500毫秒,相较于领先模型快20至200倍,费用却低40至400倍。
当然,得到答案并不够,还需要在实际应用中考量模型的可靠性。Jev引入了一种新型的训练方法——强化学习校准决策(RLCD),该方法与现有的RLHF和RLVR不同,重点在于优化决策过程及其概率,确保模型的判断准确,并能合理表达不确定性。校准决策的意思在于,使模型输出的概率值更贴近实际发生的频率,例如,被认定为0.2概率的结果,其实际发生的几率应接近20%。
关于模型的“幻觉”,官方声称Jev实现“零幻觉”,但实际上确实存在限制。Jev在对给定的选项进行选择时,可以保持模式一致性,比如当有A、B、C三个选项时,它不会自发生成一个不存在的D选择,但在正确答案是A的情况下,它仍有可能选择B,因此其“零幻觉”功能并不是绝对可靠。
在Jev的有限决策任务中,不同开发者也找到了一些实际应用的路径。一些开发者将Jev用于软件中的高频决策任务,测试显示,Vercel的工程师Pranit使用Jev替代原有的GPT-5.6 Luna安全分类器,速度提升了5到18倍,准确性也大幅提升。还有Bryo AI的技术总监Nikhil Mudholkar在商业邮件分类中同时使用了Jev与Gemini,结果显示Gemini的准确度稍高于Jev,但Jev的费用却是后者的10到20倍,使得其性价比更具优势。
另一类应用是将Jev作为LLM的审核员,以检查和验证LLM的行为,例如,有开发者通过部署Jev来监控LLM Agent并防止其越界行为。开发者Elvis Saravia将Jev集成至自己的Agent框架中,构建了自定义校验器,以确保在Agent宣称完成任务后再进行复查,从而提高了验证的效率和结果的可信度,形成了系统1与系统2的巧妙结合。相似的思路还可以应用于模型路由,先让Jev判断请求的难度,将简单任务交给快速模型,而复杂问题则交由更昂贵的推理模型处理。例如,开发者Hassan进行了下棋测试,将Jev与其他模型进行比较。