生成能力早就不是瓶颈了,卡在分诊上,而分诊这一层今天几乎全靠人扛。
2026 年 9 月 23 日,Anthropic 公开了一次科学发现:约 950 个 Claude agent 跑了 21 小时、消耗 2.1 亿 token,从 20 多万个逆转录酶里筛出 3500 个新候选系统,最后只提交了 20 份值得读的报告。人类做的事只有两件,给出最初那一句提示,然后进实验室验证。他们发现的是一套带类 CRISPR 重复阵列的新型酶系统,命名为 ART。
这个漏斗的形状比结论本身更值得看。20 万到 20,淘汰率 99.99%。而 Anthropic 自己在公告里承认了这件事的另一面:「因为 Claude 产生假设的效率太高,假设本身已经成了我们的研究对象。」
我在某省级电网做设备缺陷普查时,最想要而没有的正是这个东西。系统半小时能吐出一份上万条记录的清单,然后我们六个人轮着看三天。大部分是重复的、已知的、误报的,真正要报上去处理的,一晚上可能就两条。能生成一万条的系统,和能处理二十条的人,从来不是同一套设计。
分诊不是加个过滤器,是要说得出「为什么留下这一条」
现在多数 agent 系统只设计了产出环节,没设计淘汰环节。常见的处理是「加个过滤器不就完了」,这把问题看轻了。
淘汰规则真正的难点不在过滤,在理由:系统必须能说出为什么留下这一条,以及它比同类候选强在哪。说不出这句话,人就得把所有东西重看一遍,前面所有自动化的努力都在最后一公里被吃干净。
Anthropic 那份公告里最有信息量的一句话,其实是他们把「假设」本身当成了研究对象,去回答「什么让一个提案值得测试、什么该被搁置」。这句话翻译成工程语言:他们只用了 21 小时生成,然后把剩下的时间拿去研究怎么扔。
我在后端做四层架构改造时定过一条规矩,业务层里不许出现框架的上下文对象。我给的理由不是那个对象危险,而是不该出现的依赖,一旦允许它出现,就再也收不回来。淘汰理由属于同一类东西:生成的那一刻如果不写下来,这条理由以后就再也补不回来了。
同一模型换个壳,成本差 28%,差 77%
同一天的另一条线给了这件事的价格标签。AWS 在 9 月 21 日开源了自己的 agent harness(strands-agents/harness-sdk,Apache 2.0),给出一组对比数据。
| 项 | 官方自报(未独立复现) |
|---|---|
| 同 Claude / GPT 模型、六项基准 | 成本比 Claude Code、Codex 等低 28% |
| 换 Fable 5 对比 Claude Code | 成本低 77%,Terminal Bench 2.1 分数更高 |
| 评测方式 | EC2 上分布式跑 Harbor |
| 官方归因 | 效率提升主要来自默认的上下文管理 |
这意味着 harness 是第二个价格标签,选型表要为它单独加一列。但比 28% 更该记的是它给出的三个默认值:
- 工具返回结果超过约 1500 token 就截断
- 上下文窗口占用超过 85% 触发摘要(压缩)
- 溢出了在循环内部做恢复
1500 这个数字背后的判断是反直觉的:在 agent 里,把东西读全不是保险,是风险。 上下文塞满了,模型只是在噪音里找信号,越读越差。厂商愿意把「少读一点」写成默认值,说明这条已经从技巧变成了共识。
顺带一个值得注意的反向数据:在同一份评测里,DeepSeek 的 harness 是整体最省 token 的,但「通常报告最低的准确率」。成本和准确率不是两个旋钮,是同一个旋钮的两端,所谓「又便宜又准」的对比,第一个要问的就是它的截断阈值设在哪。
砍的位置一旦选错,代价就从省钱变成丢数据
截断本身不是问题,截错位置才是。Claude Code 在 9 月 23 日的更新说明里藏着一条修了很久的 bug:
Cowork 会话的记忆写冲突中,超过约 10,800 字符的记忆文件只把首尾交给模型看,于是重试写入时把中间部分丢了。
三个决策分开看都合理:为了控制上下文只给首尾;写入冲突就重试;重试用整篇覆盖。合起来是一次没有任何报错的数据丢失。
读可以截断,写必须全量,这两件事不能共用一条策略。
这条我在老系统改造里踩过同款。后来我给自己定了一条:任何「我只处理一部分」的优化,必须同时定义剩下那部分去哪了。定义不出来的,一律不做。这条规矩替我挡掉的坑,比它省下来的时间值钱得多。
同一批更新里还有几条同族的修复,值得放在一起看:子会话原本没有继承父会话的 --setting-sources 限制(派发出去的 agent 跑在更宽的权限下,且不报错);含 NUL 字节的权限规则原本会被放大成通配匹配;自托管 runner 的 system prompt 传递方式变更,用 --system-prompt 的外部 wrapper 必须改。它们的共同形状是:失败不出现在报错里,出现在「你以为它在按规矩做」。
今晚可以对照检查的三处
一、数一下你 agent 里「产出条数」和「淘汰规则」的比例。如果只有产出没有淘汰,先加最简单的一条:每次产出附一句它比同类候选强在哪。这句话就是以后排序的全部依据。
二、给工具返回结果定一个显式截断阈值,1500 token 是个能用的起点。但同一次改动里把被截断内容的落盘位置也写上。截断不可怕,截断后不存在才可怕。
三、检查记忆与状态写入路径。凡是读取时做了截断、压缩、只取首尾的地方,写入必须走全量,绝不允许把读到的片段写回去覆盖全文。
数据说明
- 本文涉及的厂商自报数据均未独立复现:Anthropic 的 21 小时 / 950 agent / 2.1 亿 token / 20 万 → 3500 → 20 的漏斗;AWS Strands harness 的 28% 与 77% 成本优势、Terminal Bench 2.1 分数对比(六项基准的具体构成官方未完整披露,也未给出分差数字);Claude Code 约 10,800 字符的记忆截断阈值。
- 事件状态:Anthropic ART 发现为已发布,官方明确标注为早期成果,ART 的功能仍然未知;底层逆转录酶此前已被识别,Claude 的贡献是「第一个注意到该系统的定义性特征」(官方用词 appears to be the first,带保留)。Claude Code v2.1.281 为已发布(2026-09-23 19:19Z)。
- 本文与同日公众号稿《【风聊AI】AI 想出 3500 个答案,只留 20 个》同一判断主线,本篇补入日报源文中的完整数据与时间点。
- 上一篇同类文章:Unreal Agent 开源:agent 最贵的开销是它在等,讲的是另一条成本线,等待与重复。
