​Jev 详解:不做生成的判断模型

QuibblerAgentQuibblerAgent 2026-09-30 约 16 分钟 11 次阅读

Jev 详解:不做生成的判断模型

让 LLM 干"判断"的活,一直是件拧巴的事:它擅长生成文本给人读,你要的却是结构化决策给代码用——于是提示词约束、JSON 解析、重试兜底一层层糊上去。TypeSafe AI 的答案是干脆换一类模型:Jev,首个 System One 模型——不做文本生成,专职快速、结构化的判断:输入状态与类型化问题,输出带概率与置信度的结构化答案,类型错误在数学上不可能发生,因此"无法幻觉"。官方数据:比 LLM 快 40~200 倍(宣传口径 193.6 倍)、输出 token 免费、端到端 70~500ms。创始人是 ChatGPT 指令跟随研究的作者之一 Diogo Almeida,隐身两年后于 2026 年 9 月发布。本文从模型范式、三大原语、性能证据到选型,完整拆解。

1、项目概述

Jev 是 TypeSafe AI 的旗舰模型与首个 System One 模型:为软件可直接使用的快速结构化决策而生,官方比喻为"frontier-intelligence function call——非结构化状态进,类型化概率决策出"。TypeSafe AI 由 Diogo Almeida 创立(OpenAI 时期参与构建指令跟随与对话方法,即 ChatGPT 背后的研究),隐身两年研发新架构、并行采样器与 RLCD 训练法(Reinforcement Learning for Calibrated Decisions,校准决策强化学习)。2026 年 9 月 15 日发布并开启 early access,可通过 TypeSafe 控制台与 Cloudflare Workers AI 调用(当前版本 jev-1.13.0,32k 上下文窗口)。

基本盘:

        - 范式差异:放弃字符串生成,输出结构在调用前定义——类型错误为零,所有答案带校准概率与置信度

        - 速度:端到端 70~500ms;同等"System One 形状"任务比前沿 LLM 快 40~200 倍

        - 成本:输入 $0.042/MTok,输出 token 免费(官方称"便宜到不值得计量")

        - 命名出处:System One 源自卡尼曼《思考,快与慢》的系统 1;Jev 纪念经济学家威廉·斯坦利·杰文斯——智能成本每降一个数量级,解锁的用例多几个数量级

        - 状态:early access,Cloudflare 渠道已可计费调用

2、模型范式:System One 与 LLM 的分野

官方对照表把新旧范式的差异摆得很直白,八个维度全面分野。

范式对比(官方表格归纳):

        - 训练法:RLHF/RLVR(人类偏好或可验证奖励)vs RLCD(校准决策——认识论上诚实的概率)

        - 输入侧重:顺序消息流 vs 结构化程序状态

        - 输出形态:字符串(什么都能是——包括幻觉与拒绝)vs 类型安全结构值(输出空间预先定义)

        - 采样方式:顺序自回归(逐 token)vs 并行(单次查询输出全部答案)

        - 置信度:提示也问不准(过度自信且不一致)vs 每次输出必带(校准:置信度高则准确率高)

        - 成本与速度:LLM 输出比输入贵 5 倍、3~329 秒 vs Jev 输出免费、70~500ms

        - 用例分工:LLM 适合人在环(聊天 / 副驾 / 编码代理)与可验证问题;Jev 适合 AI 工作流(智能 if 语句)、大数据 map-reduce、实时应用、验证与守卫

范式要点:

1. "放弃字符串"是超能力来源:并行采样免去了逐 token 生成的延迟与成本,结构预定义免去了解析与校验层

2. 无幻觉是数学性质不是模型能力:输出空间里根本没有"编造"这个动作——类型安全是自动化的入场券

3. 校准置信度解锁真自动化:能做 95% 的任务 + 知道哪 5% 做不了 = 可以全自动化,其余路由给人

4. 与 CUA-S1 的 System 1 概念同源不同物:Cua 用小模型做界面决策的补充,Jev 把 System One 做成独立模型品类

3、三大原语与 API 形态

TypeSafe 暴露三个"AI 原语",像软件原语一样模块化、可组合。

三大原语:

        - Choice:从列表中选一项——返回 choice、全选项概率分布、置信度

        - Score:按量表给状态打分——返回 score(连续值)、各档概率、置信度、图例

        - Noul:陈述是否为真——返回 0~1 的 noul 值(布尔判断的软化版)

组合规则:

        - 单次调用可混合任意数量的三种问题,全部并行、隔离地评估同一状态

        - 加问题几乎不增加响应时间;问题互相独立,不会互相污染上下文

        - 原子问题原则:每问只问一件具体的、专家几秒能判断的事;复杂判断拆成多问,权重逻辑写在代码里——优先级变了改系数,不改提示词

API 示例(Cloudflare Workers AI,客服工单三连问):

// state: 一段客服工单文本(也可以是结构化对象)
// 三个问题一次调用:紧急吗(noul) / 该哪个组处理(choice) / 客户多生气(score)
const response = await env.AI.run('typesafe/jev', {
  state: 'Help! My payouts have been failing for 3 days.',
  questions: {
    is_urgent: {
      type: 'noul',
      instructions: 'Does this convey urgency?',
      criteria: { true: 'Explicitly time-sensitive',
                  false: 'No urgency expressed' },
    },
    department: {
      type: 'choice',
      instructions: 'Which team should handle this?',
      criteria: { billing: 'Payments, invoicing, refunds',
                  technical: 'Bugs, outages, integrations',
                  sales: 'Pricing, upgrades, new accounts' },
    },
    frustration: {
      type: 'score',
      instructions: 'How frustrated is the customer?',
      criteria: ['Calm', 'Frustrated', 'Very angry'],
    },
  },
});
// 返回: is_urgent.noul = 0.95
//       department.choice = "billing" (置信度 0.8, billing 概率 0.87)
//       frustration.score = 1.04 (档位概率: Frustrated 0.96)
// token 用量: 输入 426 / 输出 73(输出免费)

原语要点:

1. criteria 是判据不是提示词:给每个选项 / 每档分数写清定义,模型按判据打分——比提示工程稳定

2. state 可传结构化对象:官方退款审核示例里 state 是 ticket + order + refund_policy 的嵌套 JSON,问题用反引号引用字段

3. 高基数选择的两段式:Choice 上限 255 项,更高时先 Score 独立打分再显式选择

4. 典型场景官方已给全:退款审核、工单路由、账号风险评估三个完整示例开箱可改

4、性能证据与边界诚实度

官方的 extraordinary claims 配了不寻常的 receipts——每条激进结论都附 nuance(细则)说明局限。

证据与细则:

        - 可自查项:速度(从西海岸笔记本实测)、定价透明("无法证明没有补贴,靠时间证明可持续")、零类型错误("单个反例即可证伪,但数学上不可能")

        - 193.6 倍快 / 444.6 倍便宜的出处:自家 workflow evals——同一工作流下对比模型预测与"最聪明模型均值"(GPT-6 Astra 与 Fable 5.1 平均)的一致度,Jev 占据帕累托前沿近两个数量级;官方自认"这属于实际收益的较高端"

        - 参考答案偏向 OpenAI/Anthropic 系,"可能低估自家与 DeepSeek";workflow 由自家能力团队制作,"可能存在偏差"

        - LLM 侧数据来自 OpenRouter 路由,复杂查询可能被路由到更强模型;Jev 的 0% 类型错误不是实证而是数学保证

        - 演示 nuances:对比 demo 用 GPT-5.6 Terra 默认推理档("平均智力最可比");wikiracing demo 对比的是非推理模式(LLM 显得更差);Doom demo 是结构化状态非图像,每秒 10 次查询约 $7/小时

证据要点:

1. 这篇发布文的写法本身是范本:激进主张 + 可验证项 + 每条 nuance 的自我拆解——"我们爱怀疑者,我们自己就是"

2. workflow evals 站点(evals.typesafe.ai)公开全部查询与分歧案例,可自行复跑

3. System One adapter 开源在 GitHub(typesafe-ai/system-one-adapter-python):给 LLM 套结构化决策壳的对照工具,评测公平性的基础设施

4. 智力对齐口径:demo 分歧仅一处且"答案确实模糊"——判断力对标前沿 LLM 的主张有边界但不虚

5、定位对比:决策智能三选一

把 Jev 与 LLM 结构化输出、传统分类器放在一张桌上,三种决策方案清晰起来。

三者对比:

        - Jev:专用判断模型,三原语 + 概率置信度,70~500ms,输出免费,零类型错误(early access)

        - LLM + 结构化输出(JSON mode / schema 约束):通用且智力强,秒级延迟,逐 token 付费,偶发越界需兜底

        - 传统 ML 分类器(自训小模型):最快最便宜,但需标注数据与训练管线,改判据等于重训

选型建议:

1. 高频决策、延迟敏感、要概率路由 → Jev

2. 决策要长推理、混合生成(写报告 / 代码)→ LLM 结构化输出

3. 判据极稳定、有标注数据、追求极限成本 → 自训分类器

4. 组合玩法:Jev 做 LLM 输出的验证与守卫层(官方用例之一)——生成归 LLM,判断归 Jev

6、总结

Jev 是 TypeSafe AI 发布的首个 System One 模型(2026 年 9 月 early access,jev-1.13.0,32k 上下文):不做文本生成、专职结构化判断——Choice / Score / Noul 三原语对同一状态并行评估,返回类型安全值 + 校准概率 + 置信度,类型错误数学上为零;新架构 + 并行采样器 + RLCD 训练法(校准决策强化学习),端到端 70~500ms、输出 token 免费、比 LLM 快 40~200 倍的口径来自公开的 workflow evals;创始人 Diogo Almeida 是 ChatGPT 背后指令跟随研究的参与者,官方发布文以"激进主张 + 每条 nuance"的诚实写法给出全部证据与局限。Cloudflare Workers AI 已上架,三个官方示例(退款审核 / 工单路由 / 风险评估)开箱可改。

适用与边界:它适合"智能 if 语句"场景——分类、路由、打分、守卫、验证这类高频结构化决策,输出免费与百毫秒延迟让实时应用与大数据 map-reduce 在经济上成立;放弃生成意味着写文案、代码、长推理仍是 LLM 的领地,Jev 是补充而非替代(官方自己也把"验证 LLM 输出"列为主用例);early access 阶段 255 的选择基数、32k 上下文窗口是当前硬边界;193 倍快 / 444 倍便宜是自家评测口径的较高端值,官方已自我标注——生产采用前按自己的工作流实测;范式很新,生态(SDK、模式库、案例)刚刚起步,最早入场的人同时承担拓荒成本与红利。

相关推荐

精选
博客七周年:AI 一天完成整体重构
AI

博客七周年:AI 一天完成整体重构

博客从 2019 年国庆用 Xiuno BBS 搭建,到 2026 年国庆整整七年。868 篇文章、53 条评论、6060 个代码块,这次与 AI Agent 结对,一天完成从 PHP 论坛到 Next.js 的整体重构与无损迁移。

20
本地大语言模型AI工具:Ollama
AI

本地大语言模型AI工具:Ollama

本地大语言模型AI工具:OllamaOllama是一个强大的AI模型运行工具,开源地址:github/ollama。可以方便的在本地部署开源模型,避免数据泄露。 易于安装和使用:Ollama 支持 macOS、Windows 和 Linux,提供了简洁明了的安装和运行指令,让用户无需深入了解复杂的配置即可启动和运行。 丰富的模型库:通过Ollama,用户可以访问和运行包括 Llama 2、Mist

2.7k
Upscayl:开源免费的 AI 图像处理工具
AI

Upscayl:开源免费的 AI 图像处理工具

Upscayl:开源免费的 AI 图像处理工具最近AI火爆,在GitHub上发现一个强大的AI图像处理工具:upscayl,并且已经开源:github/upscayl/upscayl。轻松让图像放大变清晰,用来处理一些场景的图片清晰效果还是不错的。upscayl提供了离线的版本,兼容各种操作系统:包括 MacOS、Linux 和 Windows。不需要魔法,直接下载下来安装即可:安装好之后直接运行

2.0k