
Gemini 4 Argon 把输出拉到 100 万 token:长轨迹 agent 的成本公式该重算了
结论先说:模型把输出窗口开到 100 万 token,不是能力升级,是把长任务里被反复重读、反复重试的那部分上下文,放大成了真正的成本陷阱。 2026-09-30,Google DeepMind 发布 Gemini 4 Argon(格隆汇 10-01 04:16 集中发稿)。最抓眼球的是输出 token 上限从 64K 直接拉到 1M,输入上下文同样 1M,初始定价每百万输入 2 美元、输出 10 美元,缓存输入 95% off,推介期结束后翻倍到 $4/$20。厂商自报基准(未独立复现):DeepSWE v1.1 77.9%、CWE-bench v1 68% 并列第一;但在 FrontierSWE v2(55% vs Astra 65.5%)、Terminal-Bench 4.0(57.4% vs Opus 5.5 66.4%)仍落后。 ...