「刚刚,爆火模型Jev全面开放,所有用户送1.2亿token」
就在刚刚,最近爆火的大模型 Jev 宣布向所有用户开放,无需申请候补名单。所有注册用户都将获得 5 美元额度,约 1.2 亿 Token。要知道 Jev 的 Token 消耗要比一般的大模型少得多,有网友实测百万输入 Token 只要花 0.042 美分,赠送的这 1.2 亿 Token 也可以放开用了。体验地址:console.typesafe.ai。
Jev 全面开放免候补名单:注册即送 5 美元、约 1.2 亿 Token
风头最劲的 Jev
没想到在大模型神仙打架的 9 月,即便是 GPT 和 Claude 也不能稳居王座,最近风头最劲、刷屏全网的模型,却是不能说话的 Jev。
TypeSafe 官方在 X 平台确认:Jev 现已向所有人开放,没有等待名单。另一位网友的总结被大量转发:大语言模型靠逐字写文章来回答问题,复杂任务很强,但输出又慢又贵;Jev 不写任何东西,你给它一个情境和一组候选答案,它选中一个并附上置信度——这让它从机制上难以幻觉、极快且极其便宜。
全文要点速览
| 维度 | 要点 |
| 开放事件 | Jev 全面开放免候补,注册送 5 美元额度(约 1.2 亿 Token) |
| 开发团队 | TypeSafe AI,前 OpenAI 研究员 Diogo Almeida 联合创办,种子轮 4000 万美元 |
| 模型定位 | 基于 Transformer 但刻意不做大语言模型,只输出类型化的「校准后的决策」 |
| 三种输出形态 | Choice 三选一分类、Score 打分、Noul 概率判断,每次回答都带置信度 |
| 性能与价格 | 端到端延迟 70–500 毫秒、比同类快 20–200 倍;输入 42 美元/十亿 token,输出免费 |
| 第三方实测 | 30 路分类准确率 98.5% 并列第一,每千次决策约 0.05 美元 |
| 典型用途 | 操作判断层、上下文压缩、模型路由、邮件分类 |
RLHF 提出者 Diogo Almeida 离开 OpenAI,创办 TypeSafe 造出 Jev
开发者 Diogo Almeida 的转向
Jev 开发者 Diogo Almeida 是 OpenAI 的研究员,他参与了 ChatGPT 的研发工作,后来又提出了基于人类反馈的强化学习算法(RLHF)。这在某种程度上定义了过去几年大语言模型的走向。可是就在这套方法把整个行业推向繁荣的同时,Almeida 却对它越来越怀疑。
「我们有了一次性成功的创新,但没有把它变成真正有用的东西。」
他花了很长时间才想明白问题出在哪里:我们一直在优化人类语言的处理能力……在四年的时间里,我们在处理人类语言方面表现得非常出色,但这对于自动化来说并没有用处,因为计算机使用的是不同的「语言」。
两年前,Almeida 离开 OpenAI,和 Erik Gafni、Sasha Sheng 一起创办了 TypeSafe AI。公司一直处于隐身状态,直到 9 月 15 日才正式亮相,同时带来两样东西:一是4000 万美元的种子轮融资,由 DCVC 领投,二是他们的第一个模型 Jev。
Jev 是什么:基于 Transformer 却只输出带置信度的类型化决策
Jev 的输出是校准后的决策
Jev 依然是一个基于 Transformer 的模型,但它刻意不是大语言模型,不会输出一个完整的句子。
你给它一段程序状态和一个预先定义好的问题,它返回的是一个类型化的答案:一个选项、一个分数,或者一个介于 0 和 1 之间的概率,外加一个置信度评分。TypeSafe 把这种输出称为「校准后的决策」。这也是 Jev 这个名字第一次进入公众视野时,很多人第一反应是困惑的原因。
要理解 Jev 在做什么,不妨先放下大语言模型的思维习惯,换成一个客服场景就好理解了。用户发来一条消息:支付服务连续几天连不上,已经影响生意。此时需要做几个判断:该交给技术还是账务团队,对方有多不满,事情是不是紧急。按 TypeSafe 的接口设计,同一次请求中的问题共享一份输入,却是独立、并行评估的,分类和紧急程度可以一起处理。具体来讲,输出有三种基本形态:
- Choice(选择):从一个你定义好的列表里选出一项,最多支持 255 个选项,适合做路由和分类。
- Score(打分):把输入放在一个你划定的尺度上打分,用来衡量紧迫程度、质量或者风险。
- Noul(概率):本质上是一次是非判断,答案是一个数字,代表这件事为真的概率。
每一次回答都会附带完整的概率分布和置信度,是强类型的结果——不需要写 JSON 提示词,不需要额外的解析器,也不用担心模型突然给结果包一层 Markdown 代码块。采用这种方式,最直接的好处是省时、省钱,也减少了自由生成带来的格式错误。
TypeSafe 自己公布过一组同题实测:同一组 27 个问题、按同一顺序分别交给 TypeSafe 和一个自回归大语言模型作答,前者花费 0.000081 美元、耗时 0.114 秒,后者花费 0.01388 美元、耗时 8.566 秒——74.9 倍的速差,171 倍的价差。终端输出里还有一个细节:TypeSafe 对每个问题返回带置信度的结构化判断,可以直接进代码;大语言模型返回的则是逐项罗列的布尔值,还得再解析一遍。
来源:TypeSafe 终端实测截图,中文整理
快 20 到 200 倍、每百万 token 0.042 美元,Jev 用便宜换市场
OpenRouter 实测数据
TypeSafe 公布的数字显示,Jev 的端到端延迟在 70 到 500 毫秒之间,比同类大语言模型快 20 到 200 倍。
按当前的公开价格,输入每十亿 token 42 美元,换成常见口径就是每百万 token 0.042 美元;输出不收费。新增的问题和选项说明仍会占用输入 token,只是不再按生成答案的长度另收一笔费用。
由于用户可以提前定义输出结果,因此模型不会产生幻觉——指的是它不会跳出预先设定的选项范围乱答,但选项范围之内答错依然是可能的。
市场的接受速度也印证了这条路:Jev 上线 Vercel 的 AI Gateway 后,24 小时内被接近 13% 的 Vercel 付费团队用上,成为 Vercel 平台采用速度最快的新模型。
第三方评测也给出了同方向的印证。OpenRouter 用 30 路分类、每模型 200 个案例做了横向对比,Jev 的准确率与 DeepSeek 并列第一,速度和成本优势明显:
| 模型 | 单次决策中位延迟 | 每 1000 次决策成本 | 30 路分类准确率 |
|---|---|---|---|
| Jev 1.13(TypeSafe) | 154 ms | 约 $0.049 | 98.5% |
| GPT-5.6 Luna(OpenAI) | 860 ms | 约 $0.179 | 96.5% |
| DeepSeek V4.1 Flash | 911 ms | 约 $0.075 | 98.5% |
| Qwen3.8 Flash | 914 ms | 约 $0.040 | 97.5% |
| GLM 5.3 Flash | 1544 ms | 约 $0.083 | 97.0% |
在一场公开的 Ably Pong 演示中,Jev 在 12 秒内做出了 47 次操作决策,而 Gemini、Claude 和 GPT 在同样时间里只做出两三次,尽管后者在大多数情况下依然给出了正确判断。演示里,程序直接把游戏里的数字交给 Jev:球的位置、运动方向、球拍的位置,以及球预计到达球拍所在位置时的纵坐标,Jev 据此从「向上、向下、保持不动」三个选项中选一个。
| 模型 | 单次决策耗时 | 17 秒内决策数 |
|---|---|---|
| Jev(TypeSafe AI) | 199 ms | 72 次 · 9 次回球 |
| GPT-5.6 Sol(OpenAI) | 3122 ms | 4 次 · 1 次回球 |
| Gemini 3.8 Flash(Google) | 3395 ms | 4 次 · 1 次回球 |
| Claude Haiku 4.5(Anthropic) | 8358 ms | 3 次 · 0 次回球 |
Jev 的打开方式:操作判断层、上下文压缩与模型路由
从浏览器代理到邮件分类
想借助 Jev 做成可玩的产品,需要游戏程序和实时通信:后端负责推进游戏、调用模型,再通过 Ably 把新状态发给浏览器。也就是说,游戏规则、画面和联网都不是 Jev 生成的,它只被插进了那个反复执行的三选一环节。
速度换来的是应用场景的扩展。Jev 可以充当电脑操作的判断层,指导代理快速执行指令;也可以用来做上下文压缩,判断哪些内容是关键信息,从而把上百万 token 的上下文迅速收窄。
Browser Use 的公开项目 jev-ultrafast 实现的就是浏览器代理:每到一个网页,先读取当前可操作的页面元素,整理成带编号的清单——哪个是按钮,哪个是输入框,叫什么名字,现在填了什么。Jev 得到的是这份结构化状态、用户目标以及操作历史,选择空间也由当前页面实际存在的元素动态生成。
上下文压缩这条路也已经有人跑通。开发者 tamara 提出的疑问很直接:都 2026 年了,上下文压缩为什么还是靠一段总结提示词?她的方案是用 Jev 给上下文里的每一次工具调用逐条打分,算出各自的「可丢弃概率」,无关内容直接丢掉。在一个 15.6 万 token 的真实编码会话演示里,这套即时压缩 3 秒跑完——读取文件、跑测试、执行命令的每一步都被打了分,得分高的丢弃、得分低的保留,上下文占比回落到 78%。
来源:X @tamarajtran 演示截图,中文整理
以查机票为例,目标可以是「查找苏黎世到伦敦的单程航班,设置指定日期、人数和舱位,出现符合条件的结果后停止」。每一轮,程序会同时问几个问题:下一步应该点击、输入、选择下拉选项,还是等待?假如点击,应该点哪个编号?假如输入,应该填哪个编号?这些问题共用同一份网页状态,但分别作答,程序只采用与实际操作匹配的那个目标。碰到需要输入城市名称的时候,程序会另行调用一个生成文本的小模型,让它根据目标和当前输入框给出要填写的内容。这套流程的收益可以直接量化:通过 Browser Use 把 Jev 用在浏览器 Agent 里,一次请求同时选「做什么」和「点哪个元素」,订一张机票的时间从 9.5 秒缩到 7 秒。
实际用例正在快速积累。Vercel 软件工程师 Pranit Sharma 表示,公司原来用 OpenAI 的 ChatGPT Luna 5.6 运行命令安全分类器,换成 Jev 后处理速度提高了 5 到 18 倍,准确性也大大提升。另一位开发者、Bryo AI 的 CTO Nikhil Mudholkar 测试了 Jev 和 Gemini 分类商业邮件的表现:Gemini 的准确率略高一些,但成本高出 10 到 20 倍。
我们也可以按这个思路自行搭建:先准备一张表,每行包含邮件标题、正文、收到时间和必要的上下文;再把业务拆成几道明确的问题。例如一封邮件写着「订单被重复扣款,希望今天处理」,可以用 Choice 判断应该进入售后、销售、合作还是其他队列;用 Noul 判断发件人是否明确要求采取行动;再用 Score 判断处理优先级。
「归根结底,这种方式将幻觉问题的处理责任稍微转移到了用户身上。」Earendil 公司的 CTO Armin Ronacher 解释道,「用户需要决定:如果这种情况出现的概率只有 50%,那或许可以忽略它;但如果概率达到 95%,那我就可以利用它了。」
Ronacher 表示,Jev 的另一个潜在应用是模型路由:预测某个任务是否需要特定模型是很有用的,但使用大型语言模型来完成这一任务会非常昂贵,而 Jev 的成本低廉且运行速度快,因此能够实现这种实时的路由功能。
Jev 接上微信:高把握自动过、低把握转人工,语义判断替代关键词
微信插件成为最热落地场景
Jev 爆火后,社区用得最多的落地场景,是把它做成微信的插件。微信群里的判断几乎全是「从有限选项里挑一个」:这条消息要不要回、要不要 @ 对方、是不是广告、要不要把人踢出群、要不要转人工、对方是不是想退款、这段话有没有违规——每一件都要在几百毫秒内出结果,这正好是 Jev 的形状。
为什么不用大模型来做这些事?三个原因。一是慢:大模型回一条要 3 到 30 秒,微信群消息是滚动的,30 秒后回复对方早就不耐烦了,而 Jev 只要 70 到 500 毫秒,够你在消息滚出屏幕之前接上。二是贵:微信机器人通常跑在便宜的常开服务器上,逐条调用大模型,几十万条消息就是一笔真金白银,Jev 把单条判断压到万分之一美元的量级。三是微信插件最怕的——它不能说错话:自由生成的大模型塞进聊天框,随时可能冒出一句不该说的话,轻则社死,重则触发风控封号,而 Jev 根本不生成文本,只从给定选项里挑,从结构上就「说不出格」。
微信运营的老大难,是「自动回复」和「转人工」之间那条线:全自动,内容控制不了;全转人工,人扛不住。Jev 给每个判断配的校准置信度,让这条线变成了一道阈值——把握高就自动过,把握低就转给人,或者转给更贵的大模型。这本来就是微信客服和社群运营一直想要的结构。还有一个隐藏升级:传统的关键词命中就回复、包含「广告」就踢人、被 @ 了就应答,对方只要换个说法就失效;Jev 把「关键词匹配」升级成了按用户意图判断的「语义判断」,回不回、踢不踢的依据不再是字面词,而是真实意图。
上手也简单:对 Codex 说一句 npx skills add typesafe-ai/skills,或在 Claude Code 里加个插件市场即可,通过 OpenRouter 能立刻调用。社区已经跑出了成熟产品 wechat-jev-hud——一个跑在 Windows 上的微信 HUD,通过截屏、定位聊天区域识别文字气泡,把 Jev 接在 OCR 和叠加层中间做实时判断。
实际效果已经有人晒了出来。HUD 常驻在微信窗口的上层,对方每发一条消息,Jev 的判断就以一张浅灰面板贴在它下面——概率分布、真实意图、危险等级,扫一眼就懂。下面两张是社区里传得最广的实测:左侧白气泡是对方,右侧绿气泡是本人,灰色面板是 Jev 的实时判断(面板里的问句与百分比按截图原样照录,未作改写)。
话题 · HUD 实时判断
今天 19:12
宝儿
你今天是不是又忘了我跟你说过什么?
Jev 判断她真的在问「你记不记得」吗? 是 7% / 否 93%
当前真实意图 想确认你不在乎她 72% / 生气想吵架 20% / 单纯考验记忆力 8%
危险等级 9 / 10
我
记得,你先别提示我,让我自己说。
那你说。
Jev 判断是否应该立刻回答具体内容? Yes 18% / No 82%
最佳动作 搜索聊天记录 91% / 硬猜 4% / 转移话题 1% / 装死 4%
等一下,我想说完整一点。
你最好是。
Jev 判断「你最好是」是否代表相信? Yes 12% / No 88%
是否进入紧急模式? Yes 96%
我想起来了。你昨天跟我说周末想出去吃饭,而且你不想每次都是你来安排。
所以呢?
Jev 判断她现在需要什么? 道歉 21% / 行动 74% / 解释 5%
所以这次我来安排,餐厅和时间我定好再告诉你,你只负责去。
这还差不多。
Jev 判断危机是否解除? Yes 94% / No 6%
建议动作 立即停止模型调用,不要画蛇添足。
另一段职场对话更直白。左侧是老板,右侧是本人,同样每句话下面压着一张 Jev 的判断面板——老板以为自己说的是「小需求」,Jev 给出的概率是另一个故事。
话题 · HUD 实时判断
18:01
老板
在吗?有个小需求
Jev 判断「小需求」真的小吗? 是 2% / 否 98%
预计影响 改个颜色 3% / 重写半个项目 97%
危险等级 9 / 10
我
在的,您说。
做个像淘宝一样的,简单点就行。
Jev 判断「简单点」指什么? 功能简单 1% / 预算简单 99%
建议动作 先确认范围,别说「好的」。
第一版只做商品展示,支付和物流后续再加,可以吗?
可以,顺便加个 AI。
Jev 判断「顺便」是否属于需求? 是 100%
需求膨胀速度 已超光速 建议动作 询问优先级。
那商品展示和 AI,您希望先做哪个?
都要。明天能上线吧?
Jev 判断正在计算可行方案…… 正常开发 0% / 连夜跑路 12% / 做个演示版 88%
建议回复 明确「演示版」。
明天可以先给您看演示版,正式上线需要另排时间。
行,你看着安排。
Jev 判断危机是否解除? 是 8% / 否 92% 只是存储了 92%
建议动作 截图留证,立即停止追加承诺。
收到。
演示版。
两张截图的共同点 · 判断被拆成了概率
两段对话的结构其实一模一样:Jev 把「对方真正想说什么」拆成一组概率,最高的一项就是答案。宝儿那句「你今天是不是又忘了」,Jev 认为「真的在问记不记得」只有 7%,把 72% 押在「想确认你不在乎她」;老板那句「有个小需求」,Jev 直接给出 97% 的「重写半个项目」。这些判断都发生在几百毫秒内,成本可以忽略——这正是它敢插进每一条微信消息里的原因。
来源:字母AI(wechat-jev-hud 实测截图),中文整理
Jevons 悖论照进 AI:智力越便宜,微小智能判断用得越广
System One Models 与微判断愿景
Jev 这个名字取自 19 世纪的经济学家 William Stanley Jevons。Jevons 提出的悖论指出,当某种商品的成本下降时,这种商品会被越来越多地使用。照此推理,智力的成本下降应该会导致智力的广泛应用——调用一旦变便宜,就会被用在更多原本不值得动用的地方。
Almeida 显然对这个类比很满意。他设想的未来不是几个庞大的应用垄断一切,而是大量微小的智能判断分散在各处运行,「更像早期互联网的样子,而不是现在人们努力搭建的那种大型应用」。
TypeSafe 至今没有公开 Jev 的具体架构,外界普遍猜测它是在某个开源大语言模型的基础上改造而来。公司自己将其称为 System One Models,取自卡尼曼关于直觉思维的概念,强调它靠的是直觉判断而不是推理链条,并且是针对具体任务专门调校出来的。官方建议把复杂判断拆成几个明确的问题,再由代码组合,而不是一股脑让模型包办。
Almeida 透露,他很早就预判到自己会走上处理合成数据这条路,这或许是他这辈子做过最明智的决定,比公司上市还明智,甚至比依赖真实人类反馈还明智。
目前市面上采用这种路线的公司只有 TypeSafe 一家,但 Ronacher 预计,随着这种模式的实用价值逐渐被验证,跟进者会陆续出现;TypeSafe 自己也计划围绕不同场景推出更多版本的模型。被问到公司是否算得上一家前沿实验室时,Almeida 说:「前沿实验室的主要产物要么是恐惧,要么是炒作,我希望我们的主要产品是智慧」,「我们不属于那种一门心思创造无限财富,或者搞宗教式叙事,或者试图在数据中心里造神的实验室」。
Jev 上线后,需求量一度超出预期,API 短暂无法正常响应。已经有人用它做小众信息流的筛选:读取过去三天的相关帖子、提出八个问题,运行时间约两秒,单次成本 0.007 美元,用来剔除诱饵内容和隐藏广告;也有团队把它接入整套营销分析流程,扫描 Meta 广告库、比较不同广告格式的存活周期、在拍摄前评估创意脚本的竞争力,把原本需要人工完成的判断提速了 30 倍,成本压到 3 美元以内。
Jev 的边界:中文准确率偏低、没有推理,长程网页实测 1/20
中文与推理是两块短板
热潮之下,Jev 的边界也很清楚。官方文档明确标注 CJK(中日韩)文本准确率偏低,英文短文本表现相对稳定——对中文场景来说,这是一道绕不开的门槛。它也没有推理能力:Browser Use 创始人实测长程浏览器交互,Jev 最终成绩 1/20,大幅落后于具备推理能力的 GPT-5.6 Luna 的 17/20。浏览器操作涉及状态空间搜索与路径回溯,Jev 不具备多步状态推演能力;社区网友的评价是,面对真实网页中未清洗的 DOM、异步加载与突发弹窗,Jev 缺乏应对能力,无法应付真实复杂的非沙盒网页。
所以「Jev 取代大模型」是个伪命题,更合理的分工是:大模型帮你想清楚判断规则,Jev 在生产环境里高频、低价地执行。判断越频繁、越琐碎、越怕错,它就越合适。
来源:APPSO 原文链接
来源:字母AI 原文链接
- 爆火模型 Jev 宣布全面开放,注册即送 5 美元约 1.2 亿 Token。它基于 Transformer 却不生成文字,只输出带置信度的类型化决策,实测比大语言模型快 20 到 200 倍,每百万 token 输入仅 0.042 美元,输出不收费。
- TypeSafe AI 由前 OpenAI 研究员、RLHF 提出者之一 Diogo Almeida 联合创办,9 月 15 日携 4000 万美元种子轮融资亮相。其首个模型 Jev 只做分类、打分和概率判断,30 路分类实测准确率 98.5%,与 DeepSeek 并列第一。
- 为什么一个不会说话的模型能刷屏 AI 圈?Jev 输出的是「校准后的决策」:Choice 三选一、Score 打分、Noul 概率判断,强类型结果无需解析器,从机制上规避跳出选项的幻觉式乱答,端到端延迟仅 70 到 500 毫秒。
- OpenRouter 用 30 路分类、每模型 200 案例横向实测:Jev 单次决策中位延迟 154 毫秒,比最快的竞争对手快 5 倍以上;每千次决策约 0.049 美元,只有 Qwen3.8 Flash 比它便宜,GPT-5.6 Luna 成本是它的 3.6 倍。
- Jev 的三种输出形态怎么用?Choice 从最多 255 个选项里选一项做路由分类,Score 在自定义尺度上打分衡量风险,Noul 输出为真概率。每次回答附带完整置信度,是强类型结果,不用写 JSON 提示词和解析器。
- 在公开的 Ably Pong 演示里,Jev 17 秒内做出 72 次操作决策并完成 9 次回球,而 GPT、Gemini 和 Claude 同样时间只决策 3 到 4 次。游戏规则和画面都不是它生成的,它只负责那个反复执行的三选一环节。
- Jev 已有大量真实用例:Vercel 用它替换 GPT 跑命令安全分类器提速 5 到 18 倍;开发者用它给 15.6 万 token 上下文做即时压缩;还有人做邮件分类和信息流筛选,单次运行约两秒、成本不到 1 美分。
- Jev 的名字取自杰文斯悖论:商品越便宜用得越多,智力也一样。TypeSafe 称其为 System One Models,靠直觉判断而非推理链条,设想未来大量微小的智能判断分散在各处运行,更像早期互联网而非少数巨型应用。
- TypeSafe 没有公开 Jev 的具体架构,外界猜测它由开源大语言模型改造而来。官方建议把复杂判断拆成几个明确的问题再由代码组合,而不是一股脑让模型包办;幻觉责任也随之转移到用户对概率阈值的把控上。
- AI 圈的风向正在变化:大模型神仙打架的 9 月,刷屏的却是不能说话的 Jev。它把生成式 AI 的自由发挥换成校准决策,用便宜和速度换市场,作者判断能决策比能聊天更值钱的时刻可能正在到来。






