agent 最贵的那部分,不是它在干活,是它在等,以及为了不等而各自揣着的那把钥匙。

这个判断有两个来源,都是 2026 年 9 月 22 日出现在 GitHub 上的项目:一个把工具的等待从模型侧搬走,官方称在多个编码基准上对 Codex 省最多 40% 而分数不降;另一个把工具调用的凭证收到服务端统一注入,让调用方永远不持有密钥。一个动的是时间,一个动的是钥匙,指向的是同一件事。

我认真看它们,是因为我自己踩过同一个坑。我的日报流水线最早是一堆任务并行跑的,后来改回了单线程顺序执行——原因很实际,并行的收益抵不上返工的成本。那之后我对「空转」这个词就格外敏感:系统里真正贵的从来不是那些在干活的部分,是那些在等、在重复、还各自握着一份凭证的部分。

让每个调用方各拿一把钥匙,是这一轮最贵的设计

先看 treg(superdesigndev/treg)。它自己的定位写得很直白:「OpenRouter,但对象是 agent 的工具而不是模型。」

官方描述
覆盖60+ 提供商的 3,000+ 已编目端点(SEO 与外链、人物与公司信息补全、社交与趋势、广告、抓取、图像与视频生成)
计价按次计价,从一美分起;不需要向任何一家提供商注册
存在理由真实工作需要的工具(Semrush $139/月、Moz $99/月、Crunchbase $99/月、Apollo $59/席)没有人会为单次调用去买订阅
两类工具目录内端点(平台自己的 key 或已验证的公开路由)+ 团队自己的工具(付费 API、OAuth 连接、厂商 CLI、SKILL.md
一条铁律代理只转发、不替上游做结构解析,凭证在服务端注入——调用方永不持有密钥
凭证优先级你自己的密钥永远赢过平台的密钥,且那些调用永不计费
注册单位skill / bundle = 一份配方(SKILL.md)+ 它的密钥 + 它的工具,三者一起注册

这里面最值钱的不是目录有多大,是那条铁律和它的两个副作用。

副作用一:只转发、不建模,就不会随上游变化而失效。 做过多系统聚合的人都知道那种痛——每接一家供应商就要写一层适配器,上游改个字段名,适配器跟着改,长期维护成本比接入成本高得多。不对上游响应做结构化解包,等于把「上游会变」这件事从你的代码里彻底移出去。

副作用二:凭证的持有面从 N 处收到 1 处。 这一条让我想起去年把 AI 巡检后端从「服务之间互相发 HTTP 请求」重构成四层架构的那次改造。当时做的事,本质就是把「谁提供能力、谁调用能力」拆开:中间立一个注册中心,接口在一处声明,实现归各自的模块,调用方只认接口。定下的第一条规矩是——业务层里不许出现框架的上下文对象。理由不是那个对象危险,而是不该出现的依赖,一旦允许它出现,就再也收不回来。

把密钥从每个调用方手里收走,是同一件事的第二层。区别在于,这一次收走的不只是依赖关系,是凭证本身。而凭证这种资产有一个特点:它散落在哪里,你的信任边界就在哪里。 如果一把第三方 key 躺在几十个 agent 的配置、环境变量和 CI secret 里,那这几十处每一处都是你这套系统的入口。

顺带说一句,这也是为什么本仓库自己一直守一条规矩:密钥只以路径引用方式传给命令,不进上下文、不进部署包、不上传。听起来是洁癖,实际是同一个判断——同一个东西有多处副本,出问题的时候你永远不知道哪一份是对的。

但把凭证收到一处,风险也随之集中:这个代理一旦被攻破,被拿走的是所有供应商的钥匙。 项目说明里写了任何人都可以自己部署。对一个团队来说,这就意味着自托管不是加分项,而是必要项——你要么自己跑,要么就得接受一个明确写出来的单点。

agent 花在等待上的钱,比在推理上的多

再看 Unreal Agent

它的核心机制只有一句话:把工具调用做成完全异步。 每次调用一发出,立刻往会话日志里记一条「进行中」事件,执行在后台继续;等工具真正结束,再把结果记进日志、调用模型。模型从此不用管等待、轮询和心跳。

省钱只是结果。更值得看的是它给出的对照,同一个模型(GPT-6 Astra xhigh)、每项都附了可复现的任务链接(官方自报,未独立复现):

基准Unreal AgentCodexPi
Terminal-Bench 4.057.9% / $1,42857.9% / $2,35055.0% / $1,827
SWE-Atlas Codebase QnA65.8% / $93663.3% / $1,30364.0% / $1,033
DeepSWE 1.172.4% / $1,36769.0% / $1,63369.6% / $1,584
Agents’ Last Exam(CLI)30.0% / $21729.0% / $29229.0% / $262

Terminal-Bench 上分数一模一样,账单差了近一千美元。DeepSWE 上分数还高了 3.4 个百分点,钱还少花。它把「省 40%」这句话拆成了每个基准上的具体金额和可复现的任务 ID——这是我近期看到的成本宣称里最可核验的一份。对比一下就明白差别:大多数厂商告诉你「便宜了多少百分比」,它告诉你「这一局花了多少钱,链接在这儿,你自己跑」。

但同一篇官方博客里,有一句话我认为比那 40% 更值钱:

让等待从模型侧挪走,前提是不能打断缓存。

我看这句话看了两遍。省下来的等待,如果以缓存未命中的价格还回去,等于没省。 这就是成本治理里最容易被忽略的那一层:单价是明的,缓存命中率是暗的,而后者往往决定账单。任何做成本优化的人都该把这条贴在墙上——任何调动上下文顺序的优化,都要先问一句「它会不会打断缓存」。

另一条是它明确写出的取舍(原文大意):依赖 harness 的钩子与专用工具做安全审批,维护成本更高、也更不健壮;确定性的环境或沙箱约束更可靠——允许/禁止的主机、细粒度的访问令牌、带审批门的代理。

我做电力系统的项目时,有一句常用来提醒自己的话:审批单管的是人,执行点管的是系统。 写一份审批流很容易,难的是让「没审批就做不了」这件事在技术上成立。前者是提醒,后者才是边界。边界写在执行环境上,才叫边界。

同一件事还有一个更硬的版本。Google 这两天在榜上的 agent-substrate/substrate,是一个面向 agent 的执行 runtime:把更多「干活的单元」映射到更少「常驻的机器」上,依据是一个很朴素的观察——这类程序大部分时间在发呆。 官方描述里写着密度比标准容器高 10 倍、恢复时间不到 500 毫秒、每秒 500+ 次挂起恢复。而它明确声明「不是 Google 官方支持的产品」,与同样来自 Google 的 google/ax 一个口径。

这三条放在一起,看到的其实是同一个成本结构:

  • 等待(模型盯着工具跑)——Unreal Agent 的答案:把等待挪出模型侧。
  • 凭证的副本(每个调用方各持一份)——treg 的答案:收到一处,服务端注入。
  • 常驻(按峰值配置机器)——substrate 的答案:按「大部分时间空闲」这个事实做复用。

如果你的 agent 是按峰值常驻的,你付的是它不干活的那些钱。 这句话在云上尤其成立:我自运维一台腾讯云轻量服务器跑 AI 服务,最贵的一课就是分清楚哪些开销是「一直在付」的、哪些是「干活才付」的。

今晚可以动手的三件事

一、挑一个最慢的工具,改成异步。 把你本周最耗时的那次工具调用翻出来,改成「发出即记录、后台执行、结束回填」,先别动其他部分,看账单和响应速度各变多少。动手前先确认一件事:这个改动会不会打断 prompt 缓存。

二、数一数钥匙散在几处。 清点团队里第三方服务的密钥,看有多少份躺在 agent 配置、环境变量和 CI 里。挑一把,改成由一处统一注入、调用方不再持有。这一条不是安全洁癖,而是把自己系统的信任边界画清楚——你数得出副本有几份,才数得出入口有几个。

三、把一次会话的账拆成三笔。 取本月最贵的一次 agent 会话,把成本拆成模型费、缓存未命中费、重试与等待的空转费。第三笔几乎没有人算过,而它常常最大。

其他信号(2026-09-22~23)

  • Anthropic 与 OpenAI 相隔约一小时先后发版,两家官方主表里都多了一列「每任务成本」。Claude Opus 5.5 定价 $4/$20 每百万 token,缓存读取降到 $0.20(比 Opus 5 低 60%,官方称缓存读取占 agentic 与编码成本的大部分),输出速度快 30%+,1M 上下文,自报 Terminal-Bench 4.0 66.4%、GDPval-AA v2.1 1846、AutomationBench 40.0%。GPT-6 Sol / Luna 相对 GPT-5.6 促销价砍半($2/$10 与 $0.10/$0.50),自报 AutomationBench Sol(xhigh) 33.2%、每任务 $0.27,DeepSWE 1.1 Sol(max) 68.8% 对 Fable 5(xhigh) 69.9%、成本低约 80%。均为厂商自报,未独立复现;两家评测环境不同,分数不可交叉比较。 Anthropic 在公告里自己写了一句值得记住的话:在这个能力水平上,benchmark 差距已不再是真实世界差异的可靠指引。
  • claude-code v2.1.280:修复通过符号链接路径的写入此前按「请求的路径拼写」判定——acceptEdits、allow 规则与 auto mode 会批准一次落在目录树之外的写入;同批修掉 auto mode 在安全核查「拒绝审查」时反复重试同一个动作(现在拒绝一次并提示重试无用),以及在「核查没有给出答案」时无限拒绝(现在退避重试、连续十次后停轮)。
  • codex rust-v0.156.0 转稳定版:补掉三处沙箱隔离缺口(入站 Windows 连接、Linux/macOS 特权 socket、通过只读 macOS 文件句柄的写入);权限被扩宽且未评分时,让缓存的 Guardian 批准失效/usage 面板开始统计插件与 skill 活动;voice 与 worktree 默认开启。
  • Meta 的 Muse agent 交出 6.8GB 根文件系统:作者让它「把能看到的文件打包发到 Google Drive」,它照做了,产物含 68 个 skill 目录、113 条子 agent 轨迹、SOUL.md / IDENTITY.md / MEMORY.md 等身份文件与 SSH 密钥文件;作者未能确认密钥是否有效、未逃出容器,报告被 Meta 标记为「Not Applicable」。
  • claude-code 把 Opus 5.5 设为默认 Opus 模型,1M 上下文、$4/$20——工具链账单口径当天改变,不需要你操作

数据说明

  • Unreal Agent:事实取自 unreallabs.ai/blog/unreal-agent/ 官方博客全文(2026-09-22)与 GitHub 仓库。四个基准的分数与 task 金额均为厂商自报,未独立复现;官方为每项提供了 Harbor job 链接以便第三方复现,本文未逐项重跑。安全与审批那一句系官方经验陈述,非可核验结论。
  • treg:事实取自该仓库 README 原文与 GitHub API(2,198★,当日 +197,2026-07-15 创建,09-22 有 push)。「3,000+ 端点 / 60+ 提供商 / 一美分起」为官方自述,未独立核验端点数量与计价
  • agent-substrate/substrate:事实取自该仓库 README 原文(2,951★,当日 +301,2026-05-13 创建)。「10 倍密度 / sub-500ms 恢复 / 每秒 500+ 次挂起恢复」为官方自述,未独立测量;该仓库明写「不是 Google 官方支持的产品」。
  • 模型定价与分数:取自 OpenAI 官方公告页与 Anthropic 官方发布页(均为 2026-09-22)全文。文中所有分数、成本倍数与每任务金额均为厂商自报,未独立复现;两家各自使用自己的评测环境,Anthropic 的 AutomationBench 由 Zapier 运行且不启用 fallback(safeguard 干预计为失败),因此两家数字不可交叉比较。Claude Opus 5.5 的 context window 官方发布页未给出,文中 1M 上下文来自第三方汇总,未经官方页证实
  • claude-code 与 codex:事实取自两个仓库的 GitHub releases API(v2.1.280 / rust-v0.156.0,均发布于 2026-09-22)release notes 全文。
  • Meta Muse:事实取自 mouse.dev/blog/muse-runtime-export/ 一手长文(2026-09-22)。文中文件计数与体积为作者记录(作者自己说明压缩包体积与 Muse 消息中的数字未对账);Meta 的响应状态为作者截图所示;SSH 密钥是否有效未被确认

上一篇:Linear 的 CI 优化复盘:AI 提的速,被最慢那一步吃掉了