模型发布

Jev 与 System One Models:声明与证据对照指南

ChatGPT 联合发明人融资 4000 万美元,做了一个拒绝写文本的前沿模型。发布当天浏览量 2500 万,公司还预先公布了反对自己的理由。本文逐条核查:哪些已验证、哪些只是厂商口径、谁该关注。

发光的分支决策树:并行概率路径流经选择门与置信度仪表盘。
插图:一个状态输入,数十个并行类型化决策输出——System One 的核心主张。

TypeSafe AI 于 2026 年 9 月 15 日发布 Jev——一个没有聊天、没有代码生成、没有散文的前沿模型,输入价格 $0.042/百万 token,输出 token 免费。创始人 Diogo Almeida 是 RLHF 与 InstructGPT 的联合发明人——这一研究谱系最终成为 ChatGPT——他花了两年隐身期构建这个他称为新模型类别的东西:System One Models,用名为 RLCD(Reinforcement Learning for Calibrated Decisions)的方法训练。发布推文一天内获得 2500 万浏览、6.1 万点赞。

这次发布值得认真对待的原因在于论证的形式。TypeSafe 随公告发布了"我们热爱怀疑者"章节——预先公布了反对自己的理由,还开源了 MIT 许可的适配器让任何人可以在竞品模型上重跑对比,并上线了带逐案分歧走查的实时评测仪表盘。本指南认真对待这些材料:每一条承重声明,对照可独立验证的证据。

After co-inventing ChatGPT, I kept asking myself: why have superhuman chat models not led to AGI? I've spent the last 2 years in stealth building a new way to train models (RLCD), and a new type of frontier AI model that we are releasing today: Jev.

— @CompleteSkeptic 2026 年 9 月 15 日

发布了什么

9 月 14-15 日同日发布了三件东西,背后是 DCVC 领投的 4000 万美元种子轮(公司 2024 年创立于旧金山,联合创始人包括 CTO Erik Gafni 与 COO Sasha Sheng,后者来自 Meta/FAIR):

1. 新模型类别:"System One Models"。名字取自卡尼曼的快速直觉认知。首个实例 Jev 只做五件事:分类、路由、打分、抽取、分支。TypeSafe 的用例定位是"聪明的 if 语句"——结构化输出作为模糊决策规则嵌入普通软件。明确不做的:聊天、写代码或散文、解释推理(根本没有可用的解释——这是合规敏感的缺口)、接受图片或音频输入、调用工具、超过约 3.2 万 token 预算。

2. 新训练方法:RLCD。RLHF 优化人类偏好,RLVR 优化可验证奖励,RLCD 则优化"校准的决策"——答案带有认识论上诚实的概率。每个输出都带置信度分数,卖点是高置信度确实与高准确率相关。

3. 新架构主张:并行采样。LLM 逐 token 生成,每个 token 条件于前一个。Jev 在单次查询中同时回答所有问题。公司将其类比于"Transformer 跳跃 RNN 的方式",并指出在请求中增加更多问题不会产生上下文污染——因为每个问题都是独立评估的。

为什么做一个不能写文本的模型

论点来自 Almeida 的发布公告:模型在聊天上已经超人多年,自动化却没有跟上——因为字符串昂贵、缓慢,且恰好在这一步不可靠。字符串需要解析和校验;它们会产生幻觉;会脱轨。放弃字符串换来三个普通 LLM 无法承诺的性质:无类型错误(输出形状预先定义——违反它"在数学上不可能")、每个答案带校准概率、并行采样带来低成本。

线程第二条推文把代价挑明:"收益不是免费的:Jev 不能生成文本。"第三条推文给出定价与命名:输入 $42/十亿 token($0.042/百万),输出 token 免费——"便宜到不用计量"——名字致敬杰文斯悖论:效率提升反而增加总消费,因为智能成本每降一个数量级,就会解锁以前不存在的用例。

RLCD 与 RLHF:承重声明

这是整个发布押注的声明,值得最严格的审视。RLHF 通过优化人类偏好让模型听话;RLVR 优化程序可验证的输出;RLCD 优化"校准决策"——模型不是因为在单次采样中正确而受奖励,而是因为它的概率是诚实的——当它说 80% 时,大约 80% 的时候应该是对的。

为什么重要:一个 95% 准确但从不传达自己何时处于那 5% 的分类器,无法被自动化。置信度分数就是产品本身。TypeSafe 文档描述了三段路由模式——高置信度自主执行,中置信度确认或补充信息,低置信度升级到人或更大的模型——阈值按操作的爆炸半径逐个设定(他们的例子:approve_transfer 要求置信度高于 0.9,check_balance 不需要)。

问题也要直说:校准有效没有公开证据。没有论文、没有可靠性曲线、没有期望校准误差数字、没有消融实验。文档自己收窄了主张——校准"在预测组层面测量;不保证单个答案正确"。在 Hacker News 发布帖中,公司没有回答的两个问题恰好是 RLCD 目标函数问题和校准维持问题。这是整个发布最大的未决问题。

API 形态

整个产品就是一个端点——POST https://api.typesafe.ai/v1/systemone——请求形态刻意不同。发送 state(非结构化字符串、对象或数组)、模型(jev-latest)和一组类型化问题。三种原语:

原语形态返回
Noul(是/否)可选的 true/false 两个分支的判据[0,1] 的值——注意不带置信度字段
ChoiceN 选一,每项带判据argmax 选择、完整概率表(和为 1)、置信度
Score有序量表打分(≥2 级)概率加权分数(可落在两级之间)、图例、概率、置信度
POST https://api.typesafe.ai/v1/systemone
Authorization: Bearer $KEY

{
  "model": "jev-latest",
  "state": {
    "ticket": "Safari 18 登录死循环,Chrome 正常",
    "account": { "plan": "pro", "age_days": 412 }
  },
  "questions": {
    "should_escalate": { "type": "noul",
      "criteria": { "true": "重复联系或流失信号",
                    "false": "首次可解决" } },
    "next_action": { "type": "choice",
      "criteria": { "refund": "...", "debug_session": "...",
                    "knowledge_base": "..." } },
    "urgency": { "type": "score",
      "criteria": ["low", "normal", "high", "critical"] }
  }
}

Almeida 在 Hacker News 上把三种原语映射到代码:"'choice' 对应 match 语句,'score' 对应排序,'noul'(Bernoulli 的简写)对应 if 语句。" 实际约束:Choice 选项上限 255(超过则组合两阶段 score-then-choose,延迟增加)、无图片音频输入、与 OpenAI chat-completions 不兼容——一家网关博客总结为"调用它需要定制客户端,而不是换个 base URL"。Python 和 JS SDK 已发布,还有 agent skill(npx skills add typesafe-ai/skills --skill typesafe-ai)。

经济账

同一次发布里存在三种定价口径,这本身就是值得报告的事实:

来源速度口径成本口径
发布推文快 20–200 倍便宜 40–400 倍(输出免费)
公司首页快 193.6 倍便宜 444.6 倍"基于 System One 任务工作流"
Business Wire 通稿"最高 100 倍"

首页的倍数来自 TypeSafe 的 工作流评测仪表盘——四个已发布工作流(客服分诊、安全事件响应、agent 轨迹可观测、发票处理),每个拆解为原子问题、由所有模型经过同一代码沙架回答。Jev 在那里公布的数字:每案例 $0.0001–$0.0011、0.3–0.5 秒;对比的前沿模型为 $0.03–$0.18。厂商自己的演示经济账:并排对比 $0.000081(0.114 秒)vs GPT-5.6 Terra 的 $0.013880(8.566 秒);Doom 演示以每秒约 10 次决策运行,成本约 $7/小时。

成本足迹是真实且一致的:$0.042/百万 token 出现在博客、首页、X 线程、LLMReference 和 Vercel 的 AI Gateway 列表五处,且两位独立测试者实测成本在同一区间。未确立的是可持续性——免费输出 token 加 4000 万美元种子轮,在证伪之前是补贴形态的安排,TypeSafe 自己也这么说:"我们无法证明它没有补贴。" 首页"输入价格比 Claude Fable 5.1 低 238 倍"的对比也忽略了 Anthropic 的缓存与批量折扣,有报道指出。

逐条声明证据核查

下表是本指南的核心——每条承重声明,评定等级。"已验证"指独立复现或可机械检验;"仅厂商"指你在信任 TypeSafe 的材料。

声明状态细则
输入 $0.042/百万 token,输出免费✅ 已验证(5 个一致来源 + 独立实测)厂商自己承认可持续性未证实;"永远"是承诺,不是合同条款
70–500ms 延迟✅ 已验证(评测仪表盘每案例 0.3–0.5s;Every 实测中位数 0.35s;Near Here 平均 0.59s)所有评测"在西海岸用笔记本跑"——没有负载下的 p50/p99、没有速率限制、没有 SLA
并行采样有效✅ 已验证(Every 测试 777 次判断 <0.7s;单调用并行 Choice 已确认)行为是真的;新颖性有争议(见反响章节)
无类型错误✅ 已验证(模式符合性是数学保证;475+ 条 HN 评论无反例)保证答案的格式,不是真值——合法形状里的错误答案仍可能
校准置信度(RLCD 的全部意义)❌ 仅厂商——无论文、无可靠性曲线、无 ECE 数字、无消融文档承认校准是组级别,不保证单答案;Hacker News 上未被回答的两个问题恰好是这两个
"不会幻觉"❌ 厂商框架把类型安全与真值混为一谈;厂商脚注承认 0% 这个数字"不是经验的"
工作流上快 193.6 倍 / 便宜 444.6 倍⚠️ 厂商工作负载峰值对照昂贵的前沿推理模型在 TypeSafe 自己的工作流上成立;独立实测约 5–25 倍,取决于对比对象
工作流准确率⚠️ 厂商仪表盘综合 67.8% vs Opus 5 的 73.1% 与 Sol 的 74.1%——诚实的说法是帕累托前沿经济学,不是峰值智能
生产就绪❌ 仅早期访问零具名客户、零收入披露、候补名单准入

独立测试结果

目前有两个早期独立实测,都小但都有信息量。

Every(评测负责人 Mike Taylor):把 27 篇已发布文章加 10 篇 AI 风格对照文,各过 21 个问题、共 37 份文档——777 次判断在 0.7 秒内完成,成本约四分之一美分。第二项由 Every CEO 执行:12 段合成文本(6 干净、6 埋了缺陷)——Jev 中位数 0.35 秒/段 vs Claude Fable 5.1 高推理档的 8.83 秒(约快 25 倍、成本约 1/580)——但 Jev 漏掉了七个埋设缺陷中的一个,而对照模型抓到了。Taylor 自己的结论:"它把活干得多好,仍是悬而未决的问题。"

Near Here(独立工程师):50 案例的事件校验任务——Jev 得分 96%(48/50),对比 Mistral Small 4 的 84% 与 Gemini 3.5 Flash-Lite 的 86%;合法事件零误拒(对照模型分别误拒 5 和 1 个),成本每 1,000 次决策 $0.043,对比 Gemini 模型的 $2.496。这是产品最好的独立证据:在狭窄的真实任务上,便宜的模型同时是最准的和便宜两个数量级的。

两项测试都是单任务、小样本。诚实的解读:在可并行、有模式形状的决策任务上,成本与延迟优势是真的;在一般判断质量上,前沿模型仍然领先——Jev 自己的仪表盘也同意这一点。

反响与"分类器"承认

Hacker News 讨论帖(475+ 评论)产生了本周最尖锐的技术辩论。工程师们在数小时内把 Jev 映射到已知技术:编码器分类器(BERT/DeBERTa)、GLiNER 类 span 模型、带 logit 置信度的受限/文法解码、文本扩散、共形预测、DSPy 类型化签名。当夜就有人发起了复现(称无需新训练——该复现本身无人验证)。关键交锋:当有人说"这基本上就是一个零样本分类器"时,Almeida 回复了"exactly right!"(完全正确)——对一个以新模型类别为框架的发布来说,这是引人注目的让步。他也拒绝披露架构("暂时保密"),对受限解码的回应是 OpenAI 式结构化输出"让模型变笨……仅仅遮蔽 logits 是不够的",并用"说随机森林'幻觉'并不公平"来辩护幻觉语义。

也有反向的砝码,影响你如何权衡这一切:TypeSafe 预先公布了反对自己的怀疑者案例,开源了 MIT 适配器让外人能在自己的工作流上重跑对比,并在评测站发布了逐案分歧走查。对于一次前沿模型发布来说,这是不寻常的证据姿态——即使那些主张仍未被证明。

注意事项

三个标题的问题。同一次发布带着 20–200 倍/40–400 倍(推文)、193.6 倍/444.6 倍(首页)和"最高 100 倍"(官方通稿)。Progressive Robot 的框架最诚实:峰值是工作负载特定的、对着前沿推理模型的,"只引用峰值的标题,引用的是最好的情况"。

评测方法有已披露的偏差。参考标签是 GPT-6 Astra 与 Claude Fable 5.1 的平均值(厂商承认这"偏向 OpenAI 和 Anthropic 的模型……我们可能低估了自己的模型"——但与共识一致不等于正确,两边共有的错误无法被检出)。工作流由 TypeSafe 自己的团队构建("可能存在一些偏差")。LLM 对比组经过 TypeSafe 自己的包装器,"比不带概率地给决策更慢更贵"。LLM 类型错误数字来自 OpenRouter,厂商承认有路由偏差——与之并列的是 Jev 非经验的 0%。

演示的注意事项。Doom 机器人跑在结构化游戏状态上,不是视觉——厂商自己注明非 AI 机器人玩得更好。Wikiracing 让对照模型跑在非推理档"为了让演示更适合观看",Choice 基数上限 255。

实用结论

如果你的产品有高频决策层,试试 Jev:工单分诊、内容审核路由、线索评分、告警分类、LLM 输出护栏。经济账是真实且经独立复现的——每千次决策几分钱、亚秒级延迟——而且置信度门控路由模式即使校准故事最后比营销的软,也真的有用。MIT 适配器让你在自己的数据上跑对比的成本很低。

以下情况要怀疑:用例需要可审计的推理(Jev 完全不提供——根本没有解释可用)、需要生产 SLA(未发布任何内容,仅早期访问)、或者你在被 444 倍这个数字推销(那是最好情况的工作流峰值)。并盯住校准问题:它决定了这是"一个新模型类别"还是"一个定价诚实的、工程精良的零样本分类器"——Almeida 本人的"exactly right!"回复恰好模糊了这个区别。

关注:校准论文或可靠性曲线(这条声明的生死证据)、种子资金烧完后的定价变化、速率限制与负载实测延迟、以及第一批具名客户。任何一项落地,都会把这次发布从"有趣的发布"升级为"基础设施"。

常见问题

Jev 是什么?

TypeSafe AI 于 2026 年 9 月 15 日发布的第一个模型——一个"System One Model",输入非结构化状态,输出带置信度分数的类型化决策(是/否、选择、打分),延迟 70–500ms。它不能生成文本、代码或解释。

Jev 的价格?

输入 $0.042/百万 token($42/十亿),输出免费。独立实测约每 1,000 次决策 $0.04–$0.05。公司承认定价可持续性未证实。

RLCD 是什么?

Reinforcement Learning for Calibrated Decisions——TypeSafe 对 RLHF/RLVR 的替代。它优化认识论上诚实的概率,而非人类偏好或可验证奖励。目前无论文、无校准证据发布。

Jev 会幻觉吗?

它不会产生类型错误——输出模式有保证。但它仍可能在合法格式里选错选项。厂商文档注明校准是组级属性,不是逐答案保证。

TypeSafe 背后是谁?

2024 年创立于旧金山:Diogo Almeida(CEO;RLHF/InstructGPT 联合发明人,前 OpenAI 后训练、前 Google Brain)、Erik Gafni(CTO)、Sasha Sheng(COO,前 Meta/FAIR)。DCVC 领投 4000 万美元种子轮。

真的比 GPT 便宜 444 倍吗?

那个数字是 TypeSafe 自己评测中、对照前沿推理模型的工作负载峰值。独立实测约 5–25 倍,取决于对比对象。所有来源的区间是 5 到 444 倍——引用你的用例,别引用标题。

来源

核对时间:2026 年 9 月 16-17 日。

延伸阅读:Gemini 3.8 Live 完整指南