做储能电站 EMS 那段时间,我给自己划过一条线:概率性输出不进控制回路。
不是不信任模型的判断力。是控制回路这个位置不接受「95% 的情况是对的」,它只认那 5% 会不会让断路器动错。
所以 9 月 15 日翻到 TypeSafe AI 那份发布时,我第一反应不是觉得它厉害,是往下找脚注。官方页面写着「不会幻觉」,而那句 0% 后面的小字是:这不是实测值,结构匹配由架构保证。 翻译过来就是,它之所以不编,是因为它被禁止写字。
把生成题换成选择题,AI 的错就从「编造」变成了「填错」——这是我认为今天最值得架构师记住的一个取舍方向。
结论先行:它没有提高那 95%,它让你问不出那 5%
先把事实压成一句。TypeSafe AI(创始人 Diogo Almeida,前 OpenAI)发布了一类叫 System One Models 的模型和首个模型 Jev:不生成字符串,只输出预先定义好 schema 的类型化值,每个输出附带校准过的概率与置信度(官方 blog,2026-09-15)。
它的技术主张与我们熟悉的路线是直接对冲的:
| 维度 | 现有 LLM 路线 | System One / Jev |
|---|---|---|
| 优化目标 | 人类偏好(RLHF)或可程序化验证(RLVR) | 校准的决策(官方称 RLCD) |
| 输入侧重 | 顺序消息、非结构化文本 | 结构化程序状态 |
| 输出形态 | 字符串,需要解析 + 校验 | 预定义 schema 的类型化值 |
| 采样方式 | 自回归,逐 token | 并行,单次查询产出全部输出 |
| 置信度 | 提示词要求的一段自述,倾向过度自信 | 每个输出附带校准概率 |
| 定价 | 输入 $0.20–$10 / MTok,输出约为输入 5 倍 | 输入 $0.042 / MTok,输出 token 免费 |
| 端到端延迟 | 3–329 秒 | 70–500 毫秒 |
官方自报在自建 workflow eval 上比现有前沿模型快 193.6 倍、便宜 444.6 倍(未独立复现)。有三处限定条件必须一起读,否则这个数字会被误用:
- 参考概率取的是 GPT-6 Astra 与 Fable 5.1 的平均值,官方自己承认这个设定「偏向 OpenAI 与 Anthropic 的模型」;
- 官方同时声明无法证明定价没有被补贴,定价长期是否可持续待验证;
- 「0% 类型错误 / 0% 幻觉」是构造保证,不是实测值。 官方原话是类型错误「在数学上不可能」发生;对照的 LLM 幻觉率取自 OpenRouter,官方主动指出这里存在路由偏差。
这三点里,第三点是最容易被忽略、也最该被记住的一条。它没有把模型变准,它把问题的形状换了。
为什么这条和「确定性优先」是同一条线
这件事和我前几天写过的那条线是接得上的:可预测的活,先别交给模型(见 Sourcegraph 让编排层先写脚本)。
那篇讲的是把确定性的活留在脚本层。这篇讲的是更进一步:让模型自己也不产出不确定的东西。两条路指向同一个判断——当能力不再是瓶颈,稀缺品就变成了「这个接口能不能被依赖」。
落到我的实际经验上,这条判断有很具体的形状。我在新能源储能电站的 EMS 上待过,也在生产现场做过智能安监。后者的误报和漏报代价是不对称的:漏一次可能是一场安全事故,误报十次只是让值班的人烦。我们当时所有的阈值设计,最后都收在同一个问题上:你到底有多确定?
而「有多确定」这件事,如果只能靠人回头去看,它就永远不是系统的一部分。
现在大多数 agent 的置信度是什么?是模型在输出里自己写的一句话。它和你真实的历史准确率没有任何绑定关系。模型说它 90% 确定,你没有任何办法验证这一档到底准不准。那些你没法自动化的活,通常不是不够准,是说不清哪里不准。
可以照着抄的两件事
第一,把输出结构从「要求它返回 JSON」改成「先定结构,再让它填」。 这不是换个措辞——前者是约定,后者是契约。约定可以被违反而你不知道,契约违反时会报错。很多所谓的「模型不稳定」,其实是接口从来没定过。
第二,把置信度做成能在历史数据上对得上的数。 做法很朴素:抽 50 条历史记录,按模型自报的置信度分档,核每一档的真实准确率有没有对上。对不上的那一档,在系统里标成不可信,交给人工。这和我在 EMS 里做的事是同一件——阈值不是拍出来的,是量出来的。
还有一条纪律容易被漏掉:给每一条重要输出补上「校验失败之后怎么办」。 注意是处置,不是校验。只加校验不加处置,等于没加。TypeSafe 那句话说得很直白:一个模型如果 95% 的时间能做对,却说不清剩下 5% 是哪些,那这件事就没法自动化。
数据说明
- 事实来源:TypeSafe AI 官方 blog《Introducing System One Models & Jev》(2026-09-15,一手源);价格、延迟、上下文与能力描述均取自官方 blog 与官方文档站。
- 未独立复现:193.6 倍快 / 444.6 倍便宜、以及全部 workflow eval 结果均为厂商自报;官方自述参考概率取 GPT-6 Astra 与 Fable 5.1 的平均值,并自认该设定偏向 OpenAI 与 Anthropic 的模型。「0% 类型错误 / 0% 幻觉」为构造保证而非实测值,官方明确说明;对照 LLM 幻觉率取自 OpenRouter,存在路由偏差。
- 事件状态:Jev 目前为 early access(waitlist 分批放开),非 GA;官方自认「无法证明定价未被补贴」,定价可持续性待长期验证。官方 FAQ 中关于「Jev 是否只是更小的 LLM」「如何应对公开基准」「训练数据来源」三项,正文未展开答案。
- 行业对照数据:同日发布的 Google Gemini 3.8 Live Extended Thinking 在 τ-Voice 通用语音任务上自报 68.6%、在 Sierra τ-Voice-banking 受监管金融场景上自报 35.1%(均为厂商自报,未独立复现),可作为「同模型在不同场景下分数不可外推」的旁证。
