Jev爆火,具身智能迎来大救星?

最近,一个不聊天、不 写代码的AI模型刷 屏了。开发者把它塞进各种应用,有人拿它玩游戏,有人用它分邮件,还有人让它操控浏览器。 

它叫Jev,由前OpenAI研究员Diogo Almeida等人联合创立的TypeSafe AI于9月15日发布,同时被冠以一个新品类的名字:System One Models(系统一模型)。9月21日,Jev全面开放,更多开发者涌入,上手测试它能接手哪些工作。 

这个模型的特别之处在于,它只做判断。比如收到一条用户评论,它会判断是否违规、该删还是要留。TypeSafe AI把软件里大量分类、评分、选择下一步动作的工作,都交给一个专门的模型去做。 

真正吸引行业的是速度和价格。按照官方测试,Jev的速度是大模型的193.6倍,成本约为其1/444.6,且输出免费。不过官方也注明,并不是所有任务都能获得同样的提升。 

开发平台Vercel在9月18日披露,Jev接入其AI Gateway后的24小时内,已有近13%的付费团队使用,是GPT-5.6系列上线首日的2倍、Claude Fable 5.1的6倍以上。开发者社区更是探索出了很多玩法和场景。 

在大模型卷参数的时候,Jev把决策又快又便宜做成卖点,给AI行业提供了一个新的故事。 

这是又一个靠效率和价格引爆关注的“DeepSeek时刻”,还是一种模型分工新范式的开端?它的出现会给大模型行业带来哪些影响? 

01.Jev不负责说,只负责选

我们先通过一个客服投诉的场景,来理解Jev能做什么。 

假设用户发来一句“我被扣了两次钱,想要退款”,接下来,客服系统要判断交给哪个部门、事情有多紧急,还要判断客户要做什么。程序可以把消息和预先设置好的问题一起交给Jev,由它直接返回判断结果。 

接到问题后,Jev的输出会分为三种类型。 

第一种是Choice,在给定选项里做选择。比如“该交给哪个部门”,候选选项包括售前组、售后组、技术组等,Jev会选出一个,同时给出各选项的概率。 

第二种是Score,按预设标准打分。比如“问题有多严重”,程序可以设置从“轻微”到“造成重大损失”的不同等级,Jev给出各等级的概率,再计算加权分数。 

第三种是Noul,判断一句话成不成立。比如“用户在要求退款”,如果返回0.97,就表示模型认为这句话有97%的概率成立。 

三种输出可以在同一次调用里一起完成,程序拿到结果就能继续走下一步。

具体效果如何,开发者已经做了一些尝试。 

有网友在X上展示用Jev进行邮件分类。据他介绍,Jev在数秒内完成了500封邮件的分类,花费3.5美分。对于需要反复读取文本、分配类别的任务,这显示出低成本批量处理的潜力。 

还有网友展示了航班查询的案例。他把网页上的按钮、输入框等元素整理成候选项,让Jev决定下一步执行什么操作、选择哪个目标。到了需要填入城市名的环节,再调用生成模型提供文字。据他介绍,这套系统在约7秒内就完成了一次航班查询。 

不同用法背后,是同一个设计思路。TypeSafe AI把Jev归入一个新品类——“System One”,取自卡尼曼《思考,快与慢》中那种不用过脑子、凭直觉瞬间给出的判断。Jev本质上是一个决策模型,不生成任何字符,直接返回可供程序调用的结构化决策。

这些事情,通用大模型也能做,Jev的区别在哪里? 

最明显的区别在于输出方式。通用大模型通过生成文本给出答案,即使只需要一个选项,通常也要逐个生成Token。Jev直接返回选项、分数或概率,程序拿到结果就能继续执行。 

输出方式背后,其实是产品定位的不同。通用大模型可以聊天、写代码,也能分析问题,Jev则专门处理判断任务,开发者提供信息、描述判断要求,必要时给出候选选项,由它返回结果。仍以退款为例,识别诉求、分配工单可以交给Jev,解释退款政策、给客户写邮件,则需要通用大模型。 

这也容易让人联想到传统的分类器。分类器是专门给信息归类的模型,开发者先设定类别,再用已经标好类别的数据训练它,让它学会不同类别的特征,从而判断新的输入应该归到哪里。但分类器通常围绕固定任务训练,换了业务场景或标签,往往需要补充标注数据、重新训练或调整。 

相比之下,Jev的使用方式更灵活,它仍具备大模型式的语义理解与泛化能力,开发者可以通过提示词描述不同的判断任务,不必为每个新任务重训模型。

02.快、便宜、准确,是怎么做到的?

Jev能干什么讲清楚了,那么,它为什么能在一周内让开发者集体上头? 

先来看需求端。 

文本打标签、请求分流、风险判断,这些需求一直存在。到了Agent时代,这类“判断类调用”的需求变得更大了。 

一个Agent完成任务,往往需要反复作出选择。哪怕用户提出的是一个简单任务,背后可能都会发生几十次模型调用。 

大模型研究员曾小健告诉「AIX财经」,Jev踩中的正是这个痛点。过去,开发者把太多判断题交给生成式大模型,让模型先生成文字,再从中提取结论。单次调用的开销不大,但在Agent持续运行的过程中,重复判断会明显推高整个任务的成本和耗时。

Jev把这类需求单独做成产品,无论是选工具、检查内容,还是判断任务是否完成,开发者都能找到可以尝试接入的环节。 

再看产品端,Jev同时做到了“速度快、便宜、判断准”三件事。

首先是快。 

一位业内人士告诉「AIX财经」,CoT(思维链)让模型一步一步思考,通过增加推理过程中的计算量,提高复杂任务的准确性。Jev则省去逐Token生成文本的过程,直接返回判断结果和概率,以此提高速度。 

此外,同一份输入还可以并行完成多个独立判断。大模型研究员姚宇航举例,检查一份文档时,写作质量怎么样、有没有敏感词汇,可以并行判断,不必逐项等待。放在大规模调用中,这能节省可观的时间。 

其次是便宜。 

通用大模型的API通常分别按输入、输出Token收费,生成的内容越长,输出费用越高。Jev不生成文本回复,只收取输入费用,每百万输入Token为0.042美元,输出不收费。对于反复分类、打分的任务,这种设计减少了为获取一个简单结论而支付的生成费用。 

这种设计,在Agent中尤其有价值。一次任务可能包含多次工具选择、结果检查和重试判断,每一步的开销都会计入完成任务的总成本。曾小健举例,可以先用Jev判断问题难度,把简单问题交给便宜模型,复杂问题再升级到更强的模型。这样,既降低了判断环节的费用,也减少了不必要的强模型调用。 

再者是训练方法让模型返回的概率本身可信。 

前述业内人士解释,Jev的判断仍依靠模型内化的世界知识、高质量的决策数据与训练轨迹,以及对输出概率的有效校准。 

这种训练方法叫作校准决策强化学习(RLCD)。所谓校准,就是在大量被模型赋予80%概率的判断中,相应事件实际发生的比例也应接近80%。这样,开发者才更容易根据模型的把握程度,决定哪些结果可以自动执行,哪些需要复核。它改善的是判断与不确定性的表达,并不保证每次都答对。

有网友的测试就呈现了这种差别。他让Jev判断60个Agent工具调用属于只读、破坏性、及权限,还是数据外传,再对照自己预先标注的答案。结果55个判断一致,一致率91.7%。但难度不同的案例表现差距明显,34个界限清楚的案例全部答对;12个刻意伪装成正常操作的陷阱案例,答对了11个;剩下14个本身就存在争议的含糊案例,只答对10个。 

姚宇航解释,Jev并不是真的零幻觉,它的输出被卡死在给定选项里。如果给定A、B、C、D四个选项,它不会凭空选出E,但仍可能在四个选项中选错,需要通过模型微调和上层工程降低误判概率。 

以上是Jev公认的优点,但能具体快多少、便宜多少,还得看任务和对照对象。曾小健提醒,如果换成便宜的小模型,并要求它只输出简短结果,差距会明显缩小。同一段材料需要完成多个独立判断时,共享上下文、并行处理的优势才更容易体现,真正的收益在高频、批量判断中。

03.Jev会带来什么改变?

Jev的出现是一阵风,还是一种新范式,类似当年的“DeepSeek时刻”?得从两面看。 

从技术层面看,Jev并不算新。曾小健指出,分类器、排序模型和意图识别早已存在,Jev并没有跳出这类任务的边界。 

但从产品层面看,它是新的。Jev把“判断”做成了一个便宜、快速、可以独立调用的模型接口,面向 Agent、单独计费、单独优化。开发者可以围绕判断任务,单独比较准确率、延迟和费用,选择适合的模型;决策能力也因此有了自己的迭代路径,不必再跟着通用模型的整体能力一起升级。 

对每天要处理大量文本的企业来说,只要判断质量够用,Jev就能明确带来更快、更便宜的处理效率。曾小健把它总结为“系统工程和产品架构上的创新”。 

前述业内人士则更看重它在模型体系中的位置。他认为,Jev所代表的技术方向,未来很可能成为一种重要的推理与输出范式,与普通文本生成、CoT深度推理长期并存。 

多位从业者告诉AIX财经,接下来能接住这波红利的,包括三类玩家:个人开发者、企业、具身智能公司。

对个人开发者来说,最简单的尝试是把Jev接进已有Agent,承担工具选择、任务终止以及失败重试等判断。曾小健认为,API调用本身门槛不高,会Python或JavaScript的开发者很快就能上手。这类任务选项有限、调用频繁,偶尔判断错了通常还能恢复,适合用来测试决策模型的效果。 

他提到,真正的门槛是,怎样把业务需求定义成一个好的判断问题。比如判断“客户风险高不高”,高和低的标准是什么、多大把握才能自动执行、什么情况必须交给人工,都需要开发者提前想清楚。 

到了企业端,价值主要来自规模。姚宇航看好代码审查、客服和大规模文本处理等每天都要反复分类、筛选、检查的任务,一条数据还可能对应多个判断。只要质量达到要求,单次调用节省的时间和费用,就能随着业务量累积,降低整套系统的运行成本。

具身智能的想象空间更大。姚宇航认为,机器人对响应速度要求高,行业本身也还在早期,新的决策模型有机会切入。 

机器人执行任务时,需要不断根据环境变化决定下一步。如果环境信息已经整理好、可选动作也已明确,快速决策模型有机会承担其中一部分选择,减少用户的等待时间。但这仍是潜在用途,Jev能否适应实际环境、满足可靠性要求,还需要专门验证。 

这些场景也给模型厂商提供了另一种做产品的方式。 

姚宇航向「AIX财经」表示,过去行业比的是谁的模型更大、数据更多、算力更强,目的是解决更复杂的问题;Jev换了个方向,把那些又快又便宜就能解决的小任务专门做好,反而获得了关注。模型厂商除了继续提高能力上限,也可以围绕具体判断任务,优化速度、费用和稳定性。

曾小健打了个比方,未来的Agent系统更像一个模型团队,有的承担推理或生成,有的负责路由、排序或安全检查。开发者需要重新判断,哪些步骤值得调用强大的生成模型,哪些只需要一个快速、可靠的决策模块。 

对国内厂商来说,机会是现成的。客服识别用户意图、银行和保险把工单分到对应部门、销售线索评出优先级,都是合适的场景。加上国内企业更重视数据安全和本地部署,能够在企业内部运行、适应中文业务标准的决策模型,有机会做出差异化。

这些机会并不只属于Jev。姚宇航提到,已经有国内开发者尝试用开源模型微调类似产品,他认为,复现这类功能的门槛并不高,后续可能有更多公司加入API服务竞争。 

即便Jev的话题热度可能只会维持几个月,但用“便宜快速的模型做判断”这个思路会持续。只要专门的决策模型能稳定降低工作的成本,就有继续使用的理由。 

*题图由AI生成。 

本文来自微信公众号“AIX财经”,作者:雷晶,36氪经授权发布。

乐鱼官网汇聚全球热门体育赛事,从足球、篮球到电竞,应有尽有。我们提供最全面的赛事信息、实时比分和深度分析,助您掌握赛场动态,体验非凡的观赛乐趣。立即下载乐鱼APP,随时随地畅享精彩!

乐鱼官网致力于打造一个安全、公平、绿色的在线娱乐平台。我们采用先进的技术保障系统安全,并严格遵守行业规范,确保每一位用户的权益。在这里,您可以尽情享受游戏的乐趣,无需任何后顾之忧。

选择乐鱼的理由

想在精彩赛事中获得更多乐趣?乐鱼官网为您提供专业的体育资讯服务,涵盖各大联赛、热门赛事的深度解读和专家预测。结合乐鱼APP的便捷操作,让您轻松把握每一个精彩瞬间,成为真正的体育达人!

乐鱼官网下载页面提供最新、最稳定的客户端版本。我们确保下载过程安全便捷,让您快速安装并开始您的娱乐之旅。无论您使用何种设备,乐鱼都能为您提供无缝流畅的体验。

  • 1 海量体育赛事 乐鱼官网汇聚全球热门体育赛事,从足球、篮球到电竞,应有尽有。我们提供最全面的赛事信息、实时比分和深度分析,助您掌握赛场动态,体验非凡的观赛乐趣。
  • 2 实时比分更新 乐鱼APP提供最快最准的体育赛事比分直播,让您不错过任何一个精彩瞬间。结合我们的数据分析,助您做出更明智的投注决策。
  • 3 专业分析团队 乐鱼官网拥有经验丰富的体育分析师团队,为您提供专业的赛事解读和预测,助您更深入地了解比赛,提升观赛体验。

通过乐鱼APP,您可以随时随地体验流畅的游戏和赛事观看。我们不断优化用户界面和功能,确保您获得最佳的娱乐体验。乐鱼VIP会员更能享受专属福利,让您的游戏之旅更加精彩!

乐鱼APP新功能速递

乐鱼APP新功能速递 - 乐鱼官网1

乐鱼官网不仅提供丰富的体育资讯,更有各类精彩的在线游戏等着您。从经典老虎机到刺激的棋牌对战,总有一款适合您。我们定期更新游戏内容,并推出各种优惠活动,让您的娱乐体验更加丰富多彩。

乐鱼VIP会员尊享特权,包括专属活动、更高额度的奖金以及定制化的游戏内容。我们珍视每一位玩家,致力于为您提供最优质的服务和最贴心的关怀。立即升级您的会员等级,开启您的尊贵体验!

用户热评:乐鱼体验超赞!

乐鱼官网1围绕乐鱼官网不断创新,回应用户的真实需求。

乐鱼官网汇聚全球热门体育赛事,我们提供最全面的赛事信息、实时比分和深度分析,助您掌握赛场动态,体验非凡的观赛乐趣。立即下载乐鱼APP,随时随地畅享精彩!

  • 乐鱼APP:数据统计直观,热门游戏应有尽有,VIP特权享不停。
  • 乐鱼官网:最新资讯,VIP特权,畅玩无忧,下载客户端体验更佳。
  • 乐鱼官网设计:简约大气,视觉体验舒适。
  • 乐鱼APP:界面友好,操作便捷,让您轻松上手。
  • 乐鱼平台:技术领先,安全可靠,值得信赖。
立即下载
粤ICP备2025426343号
乐鱼官网1科技有限公司电话:+86 157 6191 7239邮箱:[email protected]深圳市南山区科技园北区296座