Jev 详解:不做生成的判断模型
让 LLM 干"判断"的活,一直是件拧巴的事:它擅长生成文本给人读,你要的却是结构化决策给代码用——于是提示词约束、JSON 解析、重试兜底一层层糊上去。TypeSafe AI 的答案是干脆换一类模型:Jev,首个 System One 模型——不做文本生成,专职快速、结构化的判断:输入状态与类型化问题,输出带概率与置信度的结构化答案,类型错误在数学上不可能发生,因此"无法幻觉"。官方数据:比 LLM 快 40~200 倍(宣传口径 193.6 倍)、输出 token 免费、端到端 70~500ms。创始人是 ChatGPT 指令跟随研究的作者之一 Diogo Almeida,隐身两年后于 2026 年 9 月发布。本文从模型范式、三大原语、性能证据到选型,完整拆解。
1、项目概述
Jev 是 TypeSafe AI 的旗舰模型与首个 System One 模型:为软件可直接使用的快速结构化决策而生,官方比喻为"frontier-intelligence function call——非结构化状态进,类型化概率决策出"。TypeSafe AI 由 Diogo Almeida 创立(OpenAI 时期参与构建指令跟随与对话方法,即 ChatGPT 背后的研究),隐身两年研发新架构、并行采样器与 RLCD 训练法(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)。2026 年 9 月 15 日发布并开启 early access,可通过 TypeSafe 控制台与 Cloudflare Workers AI 调用(当前版本 jev-1.13.0,32k 上下文窗口)。
基本盘:
- 范式差异:放弃字符串生成,输出结构在调用前定义——类型错误为零,所有答案带校准概率与置信度
- 速度:端到端 70~500ms;同等"System One 形状"任务比前沿 LLM 快 40~200 倍
- 成本:输入 $0.042/MTok,输出 token 免费(官方称"便宜到不值得计量")
- 命名出处:System One 源自卡尼曼《思考,快与慢》的系统 1;Jev 纪念经济学家威廉·斯坦利·杰文斯——智能成本每降一个数量级,解锁的用例多几个数量级
- 状态:early access,Cloudflare 渠道已可计费调用
2、模型范式:System One 与 LLM 的分野
官方对照表把新旧范式的差异摆得很直白,八个维度全面分野。
范式对比(官方表格归纳):
- 训练法:RLHF/RLVR(人类偏好或可验证奖励)vs RLCD(校准决策——认识论上诚实的概率)
- 输入侧重:顺序消息流 vs 结构化程序状态
- 输出形态:字符串(什么都能是——包括幻觉与拒绝)vs 类型安全结构值(输出空间预先定义)
- 采样方式:顺序自回归(逐 token)vs 并行(单次查询输出全部答案)
- 置信度:提示也问不准(过度自信且不一致)vs 每次输出必带(校准:置信度高则准确率高)
- 成本与速度:LLM 输出比输入贵 5 倍、3~329 秒 vs Jev 输出免费、70~500ms
- 用例分工:LLM 适合人在环(聊天 / 副驾 / 编码代理)与可验证问题;Jev 适合 AI 工作流(智能 if 语句)、大数据 map-reduce、实时应用、验证与守卫
范式要点:
1. "放弃字符串"是超能力来源:并行采样免去了逐 token 生成的延迟与成本,结构预定义免去了解析与校验层
2. 无幻觉是数学性质不是模型能力:输出空间里根本没有"编造"这个动作——类型安全是自动化的入场券
3. 校准置信度解锁真自动化:能做 95% 的任务 + 知道哪 5% 做不了 = 可以全自动化,其余路由给人
4. 与 CUA-S1 的 System 1 概念同源不同物:Cua 用小模型做界面决策的补充,Jev 把 System One 做成独立模型品类
3、三大原语与 API 形态
TypeSafe 暴露三个"AI 原语",像软件原语一样模块化、可组合。
三大原语:
- Choice:从列表中选一项——返回 choice、全选项概率分布、置信度
- Score:按量表给状态打分——返回 score(连续值)、各档概率、置信度、图例
- Noul:陈述是否为真——返回 0~1 的 noul 值(布尔判断的软化版)
组合规则:
- 单次调用可混合任意数量的三种问题,全部并行、隔离地评估同一状态
- 加问题几乎不增加响应时间;问题互相独立,不会互相污染上下文
- 原子问题原则:每问只问一件具体的、专家几秒能判断的事;复杂判断拆成多问,权重逻辑写在代码里——优先级变了改系数,不改提示词
API 示例(Cloudflare Workers AI,客服工单三连问):
// state: 一段客服工单文本(也可以是结构化对象)
// 三个问题一次调用:紧急吗(noul) / 该哪个组处理(choice) / 客户多生气(score)
const response = await env.AI.run('typesafe/jev', {
state: 'Help! My payouts have been failing for 3 days.',
questions: {
is_urgent: {
type: 'noul',
instructions: 'Does this convey urgency?',
criteria: { true: 'Explicitly time-sensitive',
false: 'No urgency expressed' },
},
department: {
type: 'choice',
instructions: 'Which team should handle this?',
criteria: { billing: 'Payments, invoicing, refunds',
technical: 'Bugs, outages, integrations',
sales: 'Pricing, upgrades, new accounts' },
},
frustration: {
type: 'score',
instructions: 'How frustrated is the customer?',
criteria: ['Calm', 'Frustrated', 'Very angry'],
},
},
});
// 返回: is_urgent.noul = 0.95
// department.choice = "billing" (置信度 0.8, billing 概率 0.87)
// frustration.score = 1.04 (档位概率: Frustrated 0.96)
// token 用量: 输入 426 / 输出 73(输出免费)原语要点:
1. criteria 是判据不是提示词:给每个选项 / 每档分数写清定义,模型按判据打分——比提示工程稳定
2. state 可传结构化对象:官方退款审核示例里 state 是 ticket + order + refund_policy 的嵌套 JSON,问题用反引号引用字段
3. 高基数选择的两段式:Choice 上限 255 项,更高时先 Score 独立打分再显式选择
4. 典型场景官方已给全:退款审核、工单路由、账号风险评估三个完整示例开箱可改
4、性能证据与边界诚实度
官方的 extraordinary claims 配了不寻常的 receipts——每条激进结论都附 nuance(细则)说明局限。
证据与细则:
- 可自查项:速度(从西海岸笔记本实测)、定价透明("无法证明没有补贴,靠时间证明可持续")、零类型错误("单个反例即可证伪,但数学上不可能")
- 193.6 倍快 / 444.6 倍便宜的出处:自家 workflow evals——同一工作流下对比模型预测与"最聪明模型均值"(GPT-6 Astra 与 Fable 5.1 平均)的一致度,Jev 占据帕累托前沿近两个数量级;官方自认"这属于实际收益的较高端"
- 参考答案偏向 OpenAI/Anthropic 系,"可能低估自家与 DeepSeek";workflow 由自家能力团队制作,"可能存在偏差"
- LLM 侧数据来自 OpenRouter 路由,复杂查询可能被路由到更强模型;Jev 的 0% 类型错误不是实证而是数学保证
- 演示 nuances:对比 demo 用 GPT-5.6 Terra 默认推理档("平均智力最可比");wikiracing demo 对比的是非推理模式(LLM 显得更差);Doom demo 是结构化状态非图像,每秒 10 次查询约 $7/小时
证据要点:
1. 这篇发布文的写法本身是范本:激进主张 + 可验证项 + 每条 nuance 的自我拆解——"我们爱怀疑者,我们自己就是"
2. workflow evals 站点(evals.typesafe.ai)公开全部查询与分歧案例,可自行复跑
3. System One adapter 开源在 GitHub(typesafe-ai/system-one-adapter-python):给 LLM 套结构化决策壳的对照工具,评测公平性的基础设施
4. 智力对齐口径:demo 分歧仅一处且"答案确实模糊"——判断力对标前沿 LLM 的主张有边界但不虚
5、定位对比:决策智能三选一
把 Jev 与 LLM 结构化输出、传统分类器放在一张桌上,三种决策方案清晰起来。
三者对比:
- Jev:专用判断模型,三原语 + 概率置信度,70~500ms,输出免费,零类型错误(early access)
- LLM + 结构化输出(JSON mode / schema 约束):通用且智力强,秒级延迟,逐 token 付费,偶发越界需兜底
- 传统 ML 分类器(自训小模型):最快最便宜,但需标注数据与训练管线,改判据等于重训
选型建议:
1. 高频决策、延迟敏感、要概率路由 → Jev
2. 决策要长推理、混合生成(写报告 / 代码)→ LLM 结构化输出
3. 判据极稳定、有标注数据、追求极限成本 → 自训分类器
4. 组合玩法:Jev 做 LLM 输出的验证与守卫层(官方用例之一)——生成归 LLM,判断归 Jev
6、总结
Jev 是 TypeSafe AI 发布的首个 System One 模型(2026 年 9 月 early access,jev-1.13.0,32k 上下文):不做文本生成、专职结构化判断——Choice / Score / Noul 三原语对同一状态并行评估,返回类型安全值 + 校准概率 + 置信度,类型错误数学上为零;新架构 + 并行采样器 + RLCD 训练法(校准决策强化学习),端到端 70~500ms、输出 token 免费、比 LLM 快 40~200 倍的口径来自公开的 workflow evals;创始人 Diogo Almeida 是 ChatGPT 背后指令跟随研究的参与者,官方发布文以"激进主张 + 每条 nuance"的诚实写法给出全部证据与局限。Cloudflare Workers AI 已上架,三个官方示例(退款审核 / 工单路由 / 风险评估)开箱可改。
适用与边界:它适合"智能 if 语句"场景——分类、路由、打分、守卫、验证这类高频结构化决策,输出免费与百毫秒延迟让实时应用与大数据 map-reduce 在经济上成立;放弃生成意味着写文案、代码、长推理仍是 LLM 的领地,Jev 是补充而非替代(官方自己也把"验证 LLM 输出"列为主用例);early access 阶段 255 的选择基数、32k 上下文窗口是当前硬边界;193 倍快 / 444 倍便宜是自家评测口径的较高端值,官方已自我标注——生产采用前按自己的工作流实测;范式很新,生态(SDK、模式库、案例)刚刚起步,最早入场的人同时承担拓荒成本与红利。

