结论先说:模型把输出窗口开到 100 万 token,不是能力升级,是把长任务里被反复重读、反复重试的那部分上下文,放大成了真正的成本陷阱。
2026-09-30,Google DeepMind 发布 Gemini 4 Argon(格隆汇 10-01 04:16 集中发稿)。最抓眼球的是输出 token 上限从 64K 直接拉到 1M,输入上下文同样 1M,初始定价每百万输入 2 美元、输出 10 美元,缓存输入 95% off,推介期结束后翻倍到 $4/$20。厂商自报基准(未独立复现):DeepSWE v1.1 77.9%、CWE-bench v1 68% 并列第一;但在 FrontierSWE v2(55% vs Astra 65.5%)、Terminal-Bench 4.0(57.4% vs Opus 5.5 66.4%)仍落后。
成本要看总账,不是看单价
我做了二十年系统,最怕有人拿单价比胜负。长轨迹 agent 的成本公式是:总成本 = 单价 × 输出量 × 重试次数。当输出量从几万跳到上百万,重试一次就是 10 美元,跑几轮后账单比「模型聪不聪明」更先爆。
| 维度 | 旧假设(64K 输出) | 新现实(1M 输出) |
|---|---|---|
| 单次输出上限 | 约 6.4 万 token | 100 万 token |
| 重试一次代价 | 约 0.64 美元 | 约 10 美元 |
| 长任务拆分 | 被迫小步 | 诱惑一口气干完 |
| 成本主因 | 单价 | 输出量 × 重试次数 |
我过去带过一个交付战绩:4 个月做完原计划 10 个月的系统,秘诀不是加班,是范围裁剪加架构预判。把大活拆成能验证的小步,每一步只产它该产的那点上下文,下游接得住,成本才压得下来。长轨迹 agent 是同一个理:不让它一次吐 100 万,而是逼它在每个可验证节点交卷,总账反而小。
更隐蔽的是缓存命中率。长轨迹里前面几十万 token 被反复重读又没命中缓存,单价再低也救不回总账。今天 claude-code v2.1.286 修了一个 bug:它把 1 小时的缓存写入按 5 分钟档计费,缓存到底替你省了多少,之前是算错的。凡是要对外报「降了百分之多少」的指标,必须先有可验证的口径单测。
上下文给不足,模型再强也是瞎猜
去年我把 AI 巡检后端从「服务之间互相发 HTTP 请求」重构成四层架构,第一件事不是写代码,是定边界:业务层里不许出现任何 web 框架的上下文对象。上下文供给本质是边界问题,长上下文模型只是把边界画大了,没把边界画对。
今天的工具链在补这块。context-mode 把工具输出压掉 98%、codegraph 给本地代码建预索引图谱减少现场抓取,都是在让 agent 拿到的上下文又少又准。多轮 agentic 跑下来,上下文随轮数近似二次增长,九成以上的输出 token 花在内部推理上,这账不理,1M 窗口也只是更大的游泳池。
延伸阅读:AI 没干活,账单照样来——成本口径正在成为被争夺的定义权(2026-09-26)。
今晚能做的三件事
一、给长任务加一道输出预算护栏。把「最大输出」从全局上限改成每节点上限,超了就拆步。
二、把重试当一等成本项计量。在 agent 平台显式记每次重试花了多少 token,哪类任务重试率最高先砍。
三、本地建一份代码索引图谱。让 agent 取数走预索引而不是现场 grep 全文件,工具调用次数和 token 一起掉下来。
数据说明
Gemini 4 Argon 的基准分数(DeepSWE v1.1 77.9%、CWE-bench v1 68% 等)均来自 Google 官方博文,未独立复现;FrontierSWE v2、Terminal-Bench 4.0 的落后数据为 Google 在对比中披露。claude-code v2.1.286 的缓存计费 bug 修复来自其 release notes(2026-09-30)。MCP 无状态化修订与 handle 劫持攻击面、Anthropic IPO 招股书、Pi 反转支持 MCP 均为 2026-09-28~10-01 窗口内事件。
