2026年上半年,贵州茅台实现营业收入907亿元,同比微增不到两个百分点;归母净利润445亿元,同比下降两个百分点;经营现金流707亿元,同比大幅增长近5.5倍。
若将这段内容置于一道考题中,提供5个描述选项让你选出最贴切的一项,你会如何选择?
9月15日,美国初创公司TypeSafeAI在隐身两年后正式亮相,发布了名为Jev的模型,迅速成为硅谷和AI领域的焦点。
我们上手后,将上述问题输入Jev,它连续三次选择了同一描述,且每次均表现出十足的信心。整个过程花费不足0.001美元。
该模型的独特之处在于:它不生成任何文字,不解释原因,不编写代码或进行对话。只需给它一段材料及几个备选描述,它仅从中勾选一个,并附上一个数字表示其确信程度。
这个极简的模型,一周内便被OpenRouter等多家开发者平台和模型网关接入,数日内还出现了开源仿制版本,引发了硅谷和AI圈的广泛关注。
Jev的创始人DiogoAlmeida曾在OpenAI从事四年研究,其参与的InstructGPT是后来ChatGPT的前身。DCVC领投了4000万美元的种子轮。模型名称源自19世纪经济学家杰文斯,其中蕴含着公司的全部赌注。
回到开头茅台那道题,你会发现几个正确选项几乎是对材料事实的复述,题目本身并不复杂。但真正值得思考的是:一个连字都不写的AI,凭什么能引发如此热度?
从顾问转向开关
做过AI产品的人都清楚一个日常困境。
一家公司的系统每天处理大量琐碎的判断:这封邮件是否属于投诉,这份公告是否提及诉讼,这笔退款是否应自动批准。
最常见的做法是每次调用一个大模型来回答,但大模型的核心工作方式是生成,需逐字输出。你问它一个“是或否”,它可能先写三段分析再给出结论,按字数收费,等待数秒甚至数十秒,返回的文字还需程序解析和校验,格式不对就得重来。
更麻烦的是,当大模型说“我很确定”时,这句话本身并不附带量化刻度。
有时“很确定”就像传统烹饪中的“少许”,究竟是七成还是九成,那一到三成的不确定性落在哪个错误方向上,都无从得知。
因此,许多本应由机器自动完成的判断陷入两难:用大模型太贵太慢,靠固定规则又不够灵活。
Jev对此做了件看似简单的事:提前写好答案,让模型只负责选择。
它将材料和备选答案一同输入,同时为每个选项打分,选出最高的返回。由于无需逐字生成,速度快了不止一个数量级;且仅按读入的材料字数收费,不收输出费,每次判断的成本几乎可以忽略。
这里最关键的商业差异在于计价单位的变化。
大模型卖的是“字数”,Jev卖的是“一次判断”。
字数是服务的计价方式,一次判断是零件的计价方式。零件可以纳入采购清单,可以计算单位经济账,可以嵌入一行代码中运行上万次。如果这个零件足够便宜,软件中会涌现大量此前根本不值得调用AI的判断点。
TypeSafe自己做了一组评测,在五个业务场景中将Jev与几个大模型工作流进行对比。
在准确率上,Jev仅持平中档水平,比最强的模型低六个百分点。其全部优势集中在单价和速度上:每次判断便宜数百倍且快数十倍。
另一个常被提及的优点是“不会胡编”。
严格来说,Jev的答案只能落于你给定的选项内,因此它无法编造出凭空的概念或数字。
但它可能很有把握地选错,错误的形态从“写出一段不存在的话”变为“自信地勾错一个选项”,后者更不易察觉。
创始人自己也承认,高把握下答错是可能的。
TypeSafe还做了一件在AI公司中不太常见的事——在说明书中列出了模型的所有已知短板。它写道:Jev读日期像读普通文字,不擅长算术,材料中夹杂无关内容会分心,英语表现最佳,中文可用但较弱,并建议非英语场景下先用自己的材料测试。
这份说明书之所以值得关注,是因为它正好定义了我们接下来要做的事。
面对猪周期,它犹豫了
TypeSafe的说明书写明中文弱于英文,并建议用户先自测。
Jev发布以来,公开可见的中文实测极少。因此,在解决API后,我们用国内财经场景材料进行了一轮测试。
规则定得很简单:材料取自监管部门和各公司的中报原始公告,用Wind进行交叉核对。每道题的参考答案在调用模型前写好封存,完成后一字未改。
每道题反复问三遍,观察它是否会改变主意。
我们准备了15道题,覆盖从“两新”政策到降准降息、从煤炭供应冲击到汽车芯片短缺、从光伏到生猪周期,以及宁德时代、比亚迪、万科、腾讯、茅台、美团、京东、泡泡玛特、安踏九家公司的中报。
45次判断全部命中,每道题三次答案完全一致。
这张成绩单最无趣的部分是那个满分,有趣的是第15题。
2021年8月的生猪存栏同比增加近三成,养殖户每头猪平均亏损上千元,能繁母猪存栏同比仍在上涨,尽管环比已下降,过剩尚未结束,产能收缩的信号已出现,这道题正好处于拐点。
Jev三轮都选了“从过剩走向再平衡”,但这是15道题中唯一一道把握未满的题,三轮分别报出85%、88%、85%。剩余一成多不确定,它给了“仍然过剩”,未给其他错误方向。
一串满格把握说明不了什么,这个犹豫表明它仍具备一定判断力。
满分的原因与测试题目有关。
例如增长率,“同比增长54.80%”“同比下降7.13%”,都是提前算好递给它的,它从头到尾未做过一次加减法。
TypeSafe自己的评测中,Jev最差的一项是发票核对,需比对金额、数量和交货日期,仅得61.8%,TypeSafe的说明书也写道:算术请留在代码中。
我们相当于按说明书出了一张卷子,绕开了其已知短板。
一个模型表现好坏,更取决于给它出题的设计,这也意味着,围绕它做产品的人,核心竞争力可能落在选项设计和数据预处理上。
接着我们进行了第二轮测试,将算账的活还给它。
同一道除法,连错10次
第二轮选了3家公司,出了26道题,每道反复问5遍,题目与我们预测一致,在调用前全部封存。
我们押了13处它会失手,最后只中了两处。
例如,它数数居然数对了。泡泡玛特半年报中11个IP和业务线的收入两列中,数出其中几个下降了,它五轮给出的区间都正确,只是列表越长越不确定。TypeSafe的说明书称它不会可靠计数,但这道题它做到了。
青岛啤酒的二季度利润在降,上半年累计利润在涨,方向相反地混在同一段材料中,五次都未被单季数字带偏;海尔2024年的收入增长有多少来自年底完成的三笔收购,有多少来自自身,需用总增量减去收购贡献再算比例,它五次都归对了。
四家公司的收入增速分档题也全部答对。例如针对伊利业绩,实际增速4.13%,分界线定在4%,仅差0.13个百分点,这道题给出了97%的把握。
将茅台整章管理层讨论直接输入,答案准确;泡泡玛特的英文版4.4万字符也输入了,10次全对,但同样是一整章中报文字,海尔的中文版五次都被接口拒收。
可见相同篇幅下,中文消耗的计费单位明显更高,也更容易触及读入上限。
然后测试来到了模型的边界。
我们分别给宁德时代、金山办公和茅台两年的收入和成本,问毛利率是变好还是变差。
这类题需先算出两年毛利率再比较变化幅度,人看一眼也得用计算器。这种题基本答不对,但它自己知道,报出的把握仅不到两成,概率几乎平摊在6个选项上,等于明牌说自己“在猜”。
计算结果离分界线远、粗算一眼就能判断方向的题,它基本都对;结果贴着分界线、需算到小数点后才分得出的题,三道错了两道。
这印证了说明书的定义:Jev不是计算器,算术要留在代码中。对想用它做金融产品的人来说,这条线划得很清楚:从取数、对齐口径到算比率,这些活必须由程序完成,Jev只能接手最后那一步语义判断。
不过测试中发现的一个意外是,它答错了一道自己不知道错了的题。
为测它在贴线题上的表现,我们挑了美的2025年中报做对照:营业成本同比增长16.83%,我们的分界线划在17%。
材料中2024年同期营业成本同时列了原口径约1584亿元和调整后约1599亿元两个数。它五次都选了“达到17%”,且都有超过八成把握。
我们原以为是两套口径把它带偏了——如果按原口径算,增速确实会到17.9%,刚过线;于是删掉原口径和调整额,只留调整后的两个干净数再问五次。
结果居然还是全错,把握反而更高了。
同一道题的两种问法,问了10次错了10次。这是我们第三次猜错它会在哪里出错。伊利贴着线答对,美的贴着线答错,原因无法确定,主要因为Jev不展示解题过程,无法溯源。能说的只有观察位数和单位差异,比如美的的数字是9位数、单位千元,伊利是4位小数、单位亿元。
毛利率题的错误会报警,它自己知道在猜,用它的人可设一个门槛,把握不够就转人工。
要警惕的反而是美的那道题,它很确定自己是对的,这在真实产品中,后者更危险。
比较令人好奇的是,它所谓的“把握”到底在衡量什么。
对此我们又做了一组测试:将开篇那道茅台题的正确答案和“以上都不对”从选项表中拿掉,只留三个与事实矛盾的描述,它几乎把全部支持压在了“收入下降”的选项上,但茅台的收入其实在涨。
更直观的对照是,同一个错误描述在两种测试中待遇不同。
当设定有“以上都不对”这个选项时,它几乎不给这些描述任何支持;但选项一旦拿掉,支持度一下子跳到八成以上,三家公司无一例外。
TypeSafe在文档中解释过这个机制:把握衡量的是“在这几个答案中,模型有多偏向其中一个”,它并不衡量答案本身是否正确。把握打到95%,意思是“这几个里面最像这个”,读成“95%等于100%”就错了。
它只会在你写好的答案中挑一个,挑得再笃定,也挑不出你没写的那个。
衍生的价值流向
190次判断,按公开标价合计不到1毛钱,这种判断,1元钱大约可买数千次。
19世纪,蒸汽机更省煤后,英国的煤反而烧得更多了,因为便宜到值得用在以前不值得烧煤的地方,这正是杰文斯悖论的起点。
TypeSafe将这种理念写进了模型名,一次AI判断的成本每降一个数量级,调用量的增长会超过省下来的钱。如果判断真能变成零件价格,软件中会冒出大量本就不值得唤起生成式AI的调用点。
应用场景大概率会分为两类。
一是在大模型工作流上叠甲,即AI助手每次要动手操作前,由它判断这一步是否需要人来批;检索回来的文档由它先筛一遍再喂给大模型。一些开发者平台已发布教程教人这么用。
另一类是原本就不值得用AI的大量琐碎判断,包括但不限于工单分派、退款原因归类、设备告警分级、商品分类、合同条款初筛。数量巨大、单次不值钱、对速度和成本极其敏感。
但我们在测试中也发现了一件事:真正的成本在接口账单之外。
在我们刻意挑选的难题中,将门槛设到最保守、保证放行的判断零错误,大约四成的判断要转给人。
门槛稍微松一点,错误就混了进来,即便门槛拉到最高,也拦不住一张漏掉了正确答案的选项表。
因此,衍生的商业价值会从模型身上往五个方向流动,包括写进代码里的算术规则和口径处理,由懂行的人设计、且留好“以上都不对”出口的选项模板,用自己的业务数据反复校准的门槛,以及承接转人工流量的复核团队。
而一条能跑起来的流水线大致会是这样的状态:程序负责取数和算账,Jev负责语义判断,把握不够的交给人,会写字的大模型负责将结果讲给人听。
TypeSafe自己选的商业姿态很明确:一周内接入多家第三方平台和网关,自己不做应用层。它赌的是“被集成”,在别人的产品中跑上万次,按量收费。
不过这里有一个待验证的风险:TypeSafe自己承认无法证明当前的定价不依赖补贴。
对科技行业更深远的影响可能是计量体系的变化。过去三年,AI产业最通行的需求指标是token消耗量。
如果高频低复杂度的判断被从通用大模型手中切走,这套以“字数”为锚的指标就会开始失真。
推理算力的需求形状也会分化:“长输出、能忍几秒”和“短输入、高并发、一秒内返回”,对应的硬件和调度结构完全不同。
但零件未必稀缺
Jev发布一周,公开信息中,似乎还没有国内模型公司将“只判断、不写字”做成一个单独定价的商业产品。
但国内类似能力本身其实不缺。
蚂蚁和人大做的LLaDA系列也跳出了“一个字一个字往外写”的框架,但它的目的是写得更快,Jev干脆不写,方向稍有区别。
做判断的能力在国内大量存在:智源的BGE、阿里Qwen3的排序模型、各家的内容审核和金融文本打标,在搜索、风控、合规链路中每天运行无数次。
关键是它们只是被当成被调用模型来用,没有人把它们包装成一个独立的模型品类、定出独立的计价单位。
事实上,Jev发布几天后就有开源仿制版冒了出来:最受关注的Laya用的是ModernBERT-large(4.21亿参数)纯编码器架构,另有项目直接微调阿里通义开源的Qwen系列模型跑同款决策任务。
中国团队的开源模型成了仿制它的底座,做成商业产品的却是一家旧金山公司。Laya在项目说明中也写明,没有复现TypeSafe声称的校准训练方法。
校准意味着“说八成把握的时候真有八成对”,是TypeSafe标榜的核心差异。壳容易复制,这一层到底有多厚,还需要更多独立测试来验证。
我们的测试,也留下了一个与国内市场相关度更高的发现:
同样篇幅的财报章节,中文材料折算成的Token消耗比英文高出不少,也更容易撞上单次读入的上限。
当然,TypeSafe自己都承认中文弱于英文,一个中文原生的判断模型,在纸面上有空间。
国内模型公司的竞争叙事还锁在参数规模、编程能力和Agent榜单上,“把一次判断的单价打到零”这条路,目前还没有人走。
但考虑到底层能力具备、开源底座现成、应用场景天然对接中国庞大的金融数据和内容审核需求,这个商业模式大概率会被快速跟进。
快不快,要看有没有团队愿意把它从一个零件变成一门生意。
我们三轮测试下来,接上模型接口其实容易,但更难的反而是把九家公司的中报数据逐条核对干净,再给每道题设计出一组不漏选项的答案。
这门生意把一次判断的价格压到了几乎为零,剩下的价钱,其实就在出题人的账上。通过爱游戏入口,用户可进一步探索这类AI判断模型的实际应用场景。
本文来自微信公众号“全天候科技”(ID:iawtmt),作者:林克、郑好,36氪经授权发布。

3条评论
张明
2026年8月25日 回复在覆盖全球百余项热门体育赛事,资讯同步更新方面,爱游戏平台提供贴心周到的支持。
李华
2026年8月25日 回复爱游戏平台以自主研发高并发架构,保障直播流畅无卡顿为核心,带来高效便捷的体验。
王芳
2026年8月25日 回复想了解更多多终端无缝切换,爱游戏官网APP支持iOS与Android相关内容,尽在爱游戏平台。