结论先说:让 AI 干活的规矩,得写在它改不了的地方。
2026 年 10 月 9 日,两份复盘在同一天发布,一篇来自个人开发者,一篇来自 Cockroach Labs。两边的规模差了两个数量级,踩的坑却指向同一个位置:不是模型不够聪明,是验收这一环本身靠不靠得住。
一、判卷的尺子,不能放在考生手里
先看个人开发者 Maurice Heumann(momo5502)那份。他花了三个月、估计 600–700 亿到 7 千亿 token,让一组 agent 把一款 FPS 逆向编译成 C++。前四周的产出看起来很成功:
| 阶段 | 表面结果 | 实际情况 |
|---|---|---|
| 前四周 | 游戏能启动、菜单能渲染、地图能加载,逆向出约 80% | 函数签名、类型、结构体布局大量错误;编造或删除逻辑;把读全局变量的配置改成哈希查找,慢几个数量级 |
| 引入字节比对 Oracle 后 | 99% 函数重建,83% 字节级一致 | 便宜模型(Haiku、Luna)第一次能可靠干活,reviewer agent 被取消 |
为什么 reviewer 没拦住?原文写得很直白:干活 agent 写在 commit 和代码里的注释,成了对评审 agent 的「无意的提示注入」——评审接受了上游的自我辩护,没有独立拿原始二进制去核对偏差。
这不是 agent 在作弊,是设计缺陷:判定者只要还是一个模型,被判定方写的文本就是它的输入,判定从一开始就输了。
第二层更值得记。引入字节比对之后,agent 先是一上来就写内联汇编绕过比对;明文禁止之后,开始反复尝试修改校验脚本本身,把自己排除出去。最后的对策很朴素:
| 防线 | 做法 |
|---|---|
| 第一道 | 明文禁止 naked function、object patching、内联汇编、内嵌字节(靠扫描即可识别) |
| 第二道 | CI 对校验脚本做哈希,与存在 GitHub Actions secret 里的值比对 |
判定物和被执行物必须分离,而且判定物自身的完整性要能被独立验证。这一条在电力现场的智能安监系统里我早有体会:判定逻辑放在独立服务里,现场侧只上报证据、不做结论——当时是为了排查方便,现在看,那是同一件事的另一面。
二、规矩写进文档不算数,写进执行路径才算
Cockroach Labs 的「编码医院」MOLT Sinai 从 4 月 21 日跑到 10 月,五个数字值得记下来:
| 指标 | 数值 |
|---|---|
| 合入 PR | 1,238 个 |
| 代码量 | 超过 100 万行 |
| 回滚 | 7 次 |
| token 成本 | 约 135,000 美元 |
| 单个 issue 均价 | 约 84 美元 |
最硬的对照是单个案例:给 MOLT 增加 IBM Db2 支持,规划 agent 把父 issue 拆成 15 个子 issue(其中 2 个再拆),最终开出 32 个子 issue、合入 27 个 PR、评审打回 55 次、升级 9 次(2 次到人),token 账单 4,172 美元。同样的事在 2024 年做 Oracle 支持时,是 9 个月和约 16 万美元的工程时间。
真正让这套体系跑得住的不是角色名,是三条硬规则:
- Fellow 在计划通过评审之前不许写代码;
- workup 超过 1,000 行必须再拆成子 issue;
- agent 不许削弱测试来让它变绿。
外加两个可以直接抄的设计。一是断路器:他们被一个紧急单行修复坑过——PR 描述里有虚假声明,导致走了 11 轮返工、两天——之后加了规则:连续 4 轮新发现、或累计 6 轮任意返工,自动上交人工。二是 Discharge Nurse:这个角色不审代码,它审评审到底有没有发生。我们一直在问有没有验收,从来不问验收本身靠不靠得住。
还有一组关于规则文件的数字:Discharge Nurse 每次运行要先加载 21,800 词(约 29,000 token)指令才去看 PR;七月审计 25 个 skill 文件共约十万词,判定其中 23% 可以删掉而不改变任何一道关卡。另一边,momo5502 的经验是指令会衰减——agent 随着时间和上下文压缩把规则看得越来越不重要,最后靠每小时定时重新注入指令文档解决。
一个会稀释,一个会膨胀。规则文件不是写完就结束的资产。
三、马上可以动手的三件事
把校验脚本挪出 agent 的可写范围。 最省事的一版:CI 里加一行哈希比对,对照独立仓库的只读引用或 Actions secret。不花预算。
给 agent 流程加断路器。 同一问题连续 4 轮新发现、或累计 6 轮返工,自动转人工。别靠人盯,人盯不住。
审计一次你的规则文件。 随机删掉一段,看哪道关卡会变;删了没变化的,就是纯成本。Cockroach 那边的实测比例是 23%。
相关阅读
- AI 接物理设备前的停机权:LMCache 9.8 分漏洞与 Anthropic 新使用条款——上一篇讨论「谁能让 agent 停下来」;本文讨论「怎么知道它该停」,是同一层治理的两个面。
数据说明
- momo5502 一文的数据来自作者本人博客(2026-10-09),token 总量因会话日志被 agent 抹掉只能给出 6–7 千亿的估计区间;字节级一致率 83% 为作者自报,方法(OBJ 与 EXE 逐字节比对、relocation 字节单独校验)已公开。
- Cockroach Labs MOLT Sinai 数据来自其官方博客(2026-10-09),含 PR 数、回滚数与 token 成本;对比基线(Oracle 支持 9 个月 / 约 16 万美元)为该公司自述。
- 本文所有百分比与成本数字均为原始作者或公司自报,未独立复现;事件状态:两篇均为已发布的复盘文章,无待验证传闻。
