结论先说:一份 agent 产出的清单,值钱的地方不在它有多长,在你验证到第几行。

2026 年 10 月 6 日这一天,两个互不相关的主体给出了同一个数字形状。OpenAI 一次性放出 722 篇数学手稿,归入 372 个结果族,覆盖 17 个领域;其中只有 162 篇的主要结果附带了 Lean 形式化证明。同一天,Cloudflare 开源的安全审计 skill 在设计原则里写明:单次运行只找到重复运行合计发现漏洞的约一半。

一个 22%,一个 50%。它们讲的都不是「产出了多少」,而是「其中有据可查的占多少」。

三个数字,同一个形状

来源日期产出量已验证量验证率
OpenAI 722 篇数学手稿(Lean 形式化)2026-10-06722 篇162 篇约 22%
Cloudflare security-audit-skill(单次 vs 重复运行)2026-10-06重复运行找到的全部漏洞单次运行找到的约 50%
Utah Nolla Health AI 处方试点2026-10-05全部 AI 处方人工复核比例(三阶段递减)100% → 周审 → 月抽 ≥10%

前两行的共同点是:产出方自己就知道未验证的部分不可靠,并且把这句话写进了文档。 OpenAI 在仓库 README 里明说未形式化的结果可能有问题、会尽快修正;Cloudflare 则用「单次约一半」直接否定了「跑一次就算审过」的做法。

第三行是解法。Utah 的试点给的不是「多审几次」,而是一组能数出来的门禁。

门禁要能计数,不然它只是一句措辞

Utah 在 2026 年 10 月 5 日成为美国第一个允许 AI 在无医生事前审核下开具初始处方的州,范围严格限制在痤疮外用药(8 种已批准药物,禁口服、系统性激素、异维 A 酸与重度痤疮)。真正值得抄的不是「AI 能开药」,是它进入下一阶段的四个条件:

门禁项阈值是否可计数
运行时长≥ 4 周是
累计例数≥ 100 例是
与医生一致率≥ 95%是
安全停止与不良事件零遗漏 / 无严重不良事件是(前提是停止有埋点)

四条都能数。对比多数团队写的上线条件——「观察一段时间,没问题就放量」——那不是门禁,是把判断推迟到出事那天。

还有一处细节更值得学:进入第三阶段后,人工复核降到每月抽查至少 10%,但每一次不良事件与升级仍然 100% 人工看。放量时递减的是例行复核,不是异常复核。

我在国网体系里做过项目,审批门这东西最怕的不是严,是含糊。变更单上写「风险评估通过」,和写「三类风险各有一份测试报告、编号可查」,走的是两条完全不同的路。靠人背书的门是人治,靠记录放行的门才是工程。强监管行业看起来慢,有一部分慢得有道理:它把「谁签的字」换成了「留下了什么记录」。

这个口径怎么落到自己的流水线上

第一,清单统一加一列:已验证条数 / 总条数。 漏洞清单、评审意见、测试用例、迁移建议,一视同仁。只报总数,等于把未验证的部分默认算成了已验证。

第二,把「跑几次」写进验收标准。 Cloudflare 那句话的直接推论是:召回随运行次数增长,一次不收敛。设一个 N,写进流程。

第三,给每条判定路径记回落率。 OpenAI 10 月 6 日上线的 Decisions API 是个现成例子:POST /v1/decisions 只收 $0.10 / 百万 input token,输出 token 与缓存读写都不计费(同模型走 Responses 生成是 $0.10 输入 + $0.50 输出)。按官方价格粗算,若判定之后还有比例 f 的请求要回落到通用生成,总成本是 50 + f × 60 美元/百万次;只有当 f 低于约 16.7% 时,才比直接全走生成便宜。省钱的不是那个便宜的端点,是回落得够少的那条路径。

第四,把「拒绝」当成独立的返回类型处理。 Decisions 的文档把 refusal 列为一种独立 answer type,它不带概率也不带选项。先判类型再读字段,否则会把「拒答」当「否定」。这是结构化输出里又一类静默失效:多了一个你没处理的枚举值,而它外表和正常结果同构。

和「记忆 vs 文档」那条线是同一件事

我在 agent 记忆插件 vs 文档工作区 里写过一次上下文载体的分叉。回头看,那次和这次是同一个问题的两面:上下文层关心的是「让 agent 知道什么」,产出层关心的是「它的产出里有多少是可查的」。 两者都指向同一个工程动作——把「我不知道 / 我还没验」变成一条结构化记录,而不是让它消失在总数里。

Cloudflare 那个 skill 里有个设计专门做这件事:三态裁决 confirmed / needs_validation / rejected,其中 needs_validation 必须记录一条精确的未决事实,且不带严重等级。不带等级这一条极聪明,它防止了「未验证」被当成「低危」沉到队列底部。


数据说明

  • OpenAI 数学手稿数量(722 篇)、结果族(372)、领域数(17)、Lean 形式化覆盖(162 篇主要结果)来自 OpenAI 官方发布页与 openai/math 仓库 README,2026-10-06 发布。
  • Cloudflare「单次运行约找到重复运行一半」为其仓库设计原则中的自述,公司未给出进一步测试细节,属厂商自报、未独立复现。
  • Utah 试点的阶段条件、药物清单与硬停止条件来自 LA Times(10-05)、HealthExec 与 KLIF 对州协议的解读(10-06);Nolla 自报与医生一致率 >96%,未独立复现。协议签署日为 2026-09-22,10-05 为患者可注册日,第三阶段的自动直发尚未生效。
  • Decisions API 的价格、端点形态与 answer 类型来自 OpenAI 官方开发者文档(2026-10-06 公开 beta);「约 10 倍快」为官方自报,未独立复现。16.7% 的盈亏线为按官方价格的示例测算,非实测账单,实际取决于输入输出比与回落路径。
  • DeepSeek 融资金额(至少 800 亿元人民币)来自 Bloomberg 2026-10-06 引述匿名知情人士,公司与投资方均未确认,属报道而非官宣。