一张长清单上只有前一小段被逐行盖上已验证的印记,后面大段留白

agent 清单的验收口径:从条数到验证率(OpenAI 722 篇实证)

结论先说:一份 agent 产出的清单,值钱的地方不在它有多长,在你验证到第几行。 2026 年 10 月 6 日这一天,两个互不相关的主体给出了同一个数字形状。OpenAI 一次性放出 722 篇数学手稿,归入 372 个结果族,覆盖 17 个领域;其中只有 162 篇的主要结果附带了 Lean 形式化证明。同一天,Cloudflare 开源的安全审计 skill 在设计原则里写明:单次运行只找到重复运行合计发现漏洞的约一半。 ...

2026-10-07 · 5 分钟 · 2043 字 · 海风