结论先说:一份 agent 产出的清单,值钱的地方不在它有多长,在你验证到第几行。
2026 年 10 月 6 日这一天,两个互不相关的主体给出了同一个数字形状。OpenAI 一次性放出 722 篇数学手稿,归入 372 个结果族,覆盖 17 个领域;其中只有 162 篇的主要结果附带了 Lean 形式化证明。同一天,Cloudflare 开源的安全审计 skill 在设计原则里写明:单次运行只找到重复运行合计发现漏洞的约一半。
一个 22%,一个 50%。它们讲的都不是「产出了多少」,而是「其中有据可查的占多少」。
三个数字,同一个形状
| 来源 | 日期 | 产出量 | 已验证量 | 验证率 |
|---|---|---|---|---|
| OpenAI 722 篇数学手稿(Lean 形式化) | 2026-10-06 | 722 篇 | 162 篇 | 约 22% |
| Cloudflare security-audit-skill(单次 vs 重复运行) | 2026-10-06 | 重复运行找到的全部漏洞 | 单次运行找到的 | 约 50% |
| Utah Nolla Health AI 处方试点 | 2026-10-05 | 全部 AI 处方 | 人工复核比例(三阶段递减) | 100% → 周审 → 月抽 ≥10% |
前两行的共同点是:产出方自己就知道未验证的部分不可靠,并且把这句话写进了文档。 OpenAI 在仓库 README 里明说未形式化的结果可能有问题、会尽快修正;Cloudflare 则用「单次约一半」直接否定了「跑一次就算审过」的做法。
第三行是解法。Utah 的试点给的不是「多审几次」,而是一组能数出来的门禁。
门禁要能计数,不然它只是一句措辞
Utah 在 2026 年 10 月 5 日成为美国第一个允许 AI 在无医生事前审核下开具初始处方的州,范围严格限制在痤疮外用药(8 种已批准药物,禁口服、系统性激素、异维 A 酸与重度痤疮)。真正值得抄的不是「AI 能开药」,是它进入下一阶段的四个条件:
| 门禁项 | 阈值 | 是否可计数 |
|---|---|---|
| 运行时长 | ≥ 4 周 | 是 |
| 累计例数 | ≥ 100 例 | 是 |
| 与医生一致率 | ≥ 95% | 是 |
| 安全停止与不良事件 | 零遗漏 / 无严重不良事件 | 是(前提是停止有埋点) |
四条都能数。对比多数团队写的上线条件——「观察一段时间,没问题就放量」——那不是门禁,是把判断推迟到出事那天。
还有一处细节更值得学:进入第三阶段后,人工复核降到每月抽查至少 10%,但每一次不良事件与升级仍然 100% 人工看。放量时递减的是例行复核,不是异常复核。
我在国网体系里做过项目,审批门这东西最怕的不是严,是含糊。变更单上写「风险评估通过」,和写「三类风险各有一份测试报告、编号可查」,走的是两条完全不同的路。靠人背书的门是人治,靠记录放行的门才是工程。强监管行业看起来慢,有一部分慢得有道理:它把「谁签的字」换成了「留下了什么记录」。
这个口径怎么落到自己的流水线上
第一,清单统一加一列:已验证条数 / 总条数。 漏洞清单、评审意见、测试用例、迁移建议,一视同仁。只报总数,等于把未验证的部分默认算成了已验证。
第二,把「跑几次」写进验收标准。 Cloudflare 那句话的直接推论是:召回随运行次数增长,一次不收敛。设一个 N,写进流程。
第三,给每条判定路径记回落率。 OpenAI 10 月 6 日上线的 Decisions API 是个现成例子:POST /v1/decisions 只收 $0.10 / 百万 input token,输出 token 与缓存读写都不计费(同模型走 Responses 生成是 $0.10 输入 + $0.50 输出)。按官方价格粗算,若判定之后还有比例 f 的请求要回落到通用生成,总成本是 50 + f × 60 美元/百万次;只有当 f 低于约 16.7% 时,才比直接全走生成便宜。省钱的不是那个便宜的端点,是回落得够少的那条路径。
第四,把「拒绝」当成独立的返回类型处理。 Decisions 的文档把 refusal 列为一种独立 answer type,它不带概率也不带选项。先判类型再读字段,否则会把「拒答」当「否定」。这是结构化输出里又一类静默失效:多了一个你没处理的枚举值,而它外表和正常结果同构。
和「记忆 vs 文档」那条线是同一件事
我在 agent 记忆插件 vs 文档工作区 里写过一次上下文载体的分叉。回头看,那次和这次是同一个问题的两面:上下文层关心的是「让 agent 知道什么」,产出层关心的是「它的产出里有多少是可查的」。 两者都指向同一个工程动作——把「我不知道 / 我还没验」变成一条结构化记录,而不是让它消失在总数里。
Cloudflare 那个 skill 里有个设计专门做这件事:三态裁决 confirmed / needs_validation / rejected,其中 needs_validation 必须记录一条精确的未决事实,且不带严重等级。不带等级这一条极聪明,它防止了「未验证」被当成「低危」沉到队列底部。
数据说明
- OpenAI 数学手稿数量(722 篇)、结果族(372)、领域数(17)、Lean 形式化覆盖(162 篇主要结果)来自 OpenAI 官方发布页与
openai/math仓库 README,2026-10-06 发布。 - Cloudflare「单次运行约找到重复运行一半」为其仓库设计原则中的自述,公司未给出进一步测试细节,属厂商自报、未独立复现。
- Utah 试点的阶段条件、药物清单与硬停止条件来自 LA Times(10-05)、HealthExec 与 KLIF 对州协议的解读(10-06);Nolla 自报与医生一致率 >96%,未独立复现。协议签署日为 2026-09-22,10-05 为患者可注册日,第三阶段的自动直发尚未生效。
- Decisions API 的价格、端点形态与 answer 类型来自 OpenAI 官方开发者文档(2026-10-06 公开 beta);「约 10 倍快」为官方自报,未独立复现。16.7% 的盈亏线为按官方价格的示例测算,非实测账单,实际取决于输入输出比与回落路径。
- DeepSeek 融资金额(至少 800 亿元人民币)来自 Bloomberg 2026-10-06 引述匿名知情人士,公司与投资方均未确认,属报道而非官宣。
