同一天,AI 行业在两个相反的方向上同时加速:成本曲线陡降,信任曲线开裂。DeepSeek 把百万 token 上下文的缓存成本压到每 token 890 字节,Cognition 用开源底座以四分之一价格逼近前沿;而 OpenAI 被两位数学家先后逼出一句要命的表态:「不能排除去标识化数据参与了训练」。这篇文章把当天的四条信号拆成对架构师真正有用的决策依据。

一、OpenAI 数学争议:去标识化去得掉名字,去不掉思想

先说清楚事情脉络。OpenAI 本周宣布用一个未发布的内部模型组织约 1 万个 AI 智能体、88 小时给出纳维-斯托克斯方程存在性与光滑性问题的证明,同步公开 166 页论文和 Lean 验证代码。随后纽约大学教授 Tristan Buckmaster 公开质疑:他和 Anthropic 研究员 Levent Alpöge 在相近方向研究了数月,且曾用 Codex 处理过相关对话,OpenAI 是否接触了这些内容。

9 月 10 日,第二位数学家 Andreas Thom 公开指控 OpenAI「不诚实」:OpenAI 上月宣布的十项数学成果中,非 sofic 群方向的工作没有引用 Thom 与 Gábor Kun 的近期成果,遭质疑后悄悄修改了文稿。Thom 邮件质询 OpenAI 研究员 Bubeck 与 Sellke「我与 ChatGPT 的对话是否进入了训练数据」,得到的回答只覆盖「对话是否被直接检索」,刻意不回答「是否进入训练池」。OpenAI 的官方口径是:「可能性很低,但我们不能排除来自其产品使用数据的去标识化数据帮助改进了我们的模型。」

Thom 的反驳值得每个技术决策者背下来:去标识化能去掉名字,去不掉数学思想的内容。

同一天 Hacker News 上出现了两个高分帖:「Tell HN:OpenAI 不断重新启用 allow training 设置」(420 分)和「能否信任 OpenAI 处理未发表数学」(586 分)。信任危机已经从单点事件变成系列叙事。

对架构师的实际影响有三层:

  1. 供应链机密性假设要重写。「在商业 AI 工具里讨论未公开研究等于无泄露」这个默认假设不再成立。当厂商既是你的工具供应商、又是发现赛场的竞争者,利益冲突是结构性的。
  2. 数据回流策略必须合同化。企业采购 agent 平台时,训练数据回流条款、零保留承诺、审计权要写进采购与合规清单,而不是依赖界面上的开关——HN 的指控恰恰是开关会被重新打开。
  3. 个人与团队同理。未发表的技术方案、核心算法思路,喂给「可能与雇主竞争」的厂商工具,等于向行业广播。

需要保持公允的是:目前没有既定事实认定 OpenAI 不当使用了研究者成果,双方各执一词,Altman 公开否认指控。但「不能排除」这四个字本身,已经足够改写工程默认值。

二、DeepSeek V4.1-Flash:把降本写进架构标题

9 月 10 日,DeepSeek 正式发布 V4.1-Flash 并同步公开 MIT 协议权重与技术报告,报告副标题直白得少见:《Pushing the Limits of KV Cache Compression》。

关键规格如下:

项目V4.1-FlashV4-FlashV4 Pro
总参数552B(另加 196B Engram)284B1.6T
每 token 激活8B(prefill)/ 16B(decode)13B49B
全局 KV cache890 字节/token(FP4)约为其 4 倍不适用
上下文 / 最大输出1M / 384K1M / 384K1M
协议MITMITMIT

架构上的核心是新设计的 CED(Causal Encoder-Decoder):40 层网络切成 20 层因果编码器加 20 层解码器,用编码器输出直接构造解码器的全局 KV cache,让大部分 prompt token 绕开完整的解码器计算。叠加 CSA2 压缩稀疏注意力、SWA 有界重放、DSpark 投机解码后,单 token 的 decode FLOPs 几乎不随上下文长度增长,百万 token 上下文的缓存不到 1GB。

为什么这件事对 agent 工程比对聊天更关键?因为长程智能体的负载是输入密集型的:读一个代码仓库、翻长工具调用记录、啃一份百万 token 的文档,每一步都在为输入付费。计算、存储、带宽三者叠加,KV cache 的容量与传输才是部署成本的主瓶颈。DeepSeek 把整份报告的卖点从「更聪明」换成「更便宜」,这个叙事切换本身就是行业定价权转移的信号。

⚠️ 反面教训藏在运营动作里:9 月 14 日中午起,所有 deepseek-v4-pro 请求将被自动路由到 V4.1 Flash 并按 Flash 价格计费(高峰输入价约 4.4 倍降幅)。模型名不变,但底座是完全不同的新架构,不是微调,system prompt 遵循度可能漂移。生产环境按模型名路由的团队,迁移风险就藏在名字不变的那天。9 月 14 日之前,用自有评测集对比一遍 deepseek-flash,并显式决定是否主动切换模型名,让变更出现在自己的日志里。

分数层面保持清醒:自报成绩两极分化,Terminal-Bench 2.1 拿 90.6 分超过 Claude Opus 5.0 的 89.1,但 Terminal-Bench 4.0 只有 31.2 对 51.8,HLE 也明显落后。难得的是模型卡主动标注了 CSA2 选择误差与 SWA 近似重建在未测试边界情形可能退化。所有分数均为厂商自报、未独立复现。

三、Cognition 双线出手:SWE-2 模型与 RSA-260 分解

Cognition 同日发布编码模型 SWE-2,底座是月之暗面开源的 Kimi K3(2.8 万亿参数),在此之上做自己的强化学习后训练,首次把 RL 扩展到多万亿参数规模。

基准SWE-2Kimi K3 原版Fable 5.1GPT-6 Astra
FrontierCode 1.1 Main50.0%44.2%50.9%53.3%
DeepSWE 1.173.0%68.5%67.4%74.1%
Terminal-Bench 2.192.8%88.3%91.4%89.9%
Terminal-Bench 427.3%21.5%55.8%57.9%

性价比是重点:FrontierCode 上与 Fable 5.1 差距不到 1 分,成本低 64%;距 GPT-6 Astra 几分,成本仅四分之一。训练方法上有一个可直接借鉴的设计:一次 RL run 同时训练所有推理档位,奖励函数 R = S − λₑ·C,λₑ 按底座 Pareto 前沿的局部斜率校准,把推理成本直接写进训练目标而非事后截断。行为层面效果显著:平均步数从 127 降到 53,首次真实代码编辑的中位步数从 48 降到 18。

「开源底座 + 领域 RL」这条路第一次交出对标前沿的成绩单,意味着手握海量任务数据的团队,「买底座、自己练」有了可参照的成本-质量坐标。闭源编码模型的溢价空间被实质性压缩。

同日公布的 RSA-260 分解则是另一个物种的成果:一名研究员驱动多个 Devin,三周分解 260 位 RSA 挑战数,创公开纪录(约 4900 GPU 天、40 万美元,成本较此前公开最优低约 10 倍),因子提交 FactorDB 可独立验证。作者坦承全程无算法创新、纯性能工程,并在文末自省:做完之后自己对数域筛法和 GPU 编程的理解反而不如亲自做。这句关于「agent 代工科研导致人类能力流失」的自我怀疑,比纪录本身更值得记录。

四、三大编码 agent 同周发版,修的全是边界

把镜头拉回工程侧,三大编码 agent 本周的发版主题罕见地一致:

  • Codex Python SDK 0.154.0:新增 max/ultra 推理档位,引入 ExternalMessage 原语——外部内容可加入活跃任务、能调用工具,但不授予用户级审批权限
  • Claude Code 2.1.268:网关公网访问一次性告警、计费与花费计米器对齐、自托管 runner 会话状态清理;
  • OpenClaw 2026.6.35(六月 LTS 收官版):不可信响应体边界绑定、昂贵操作前拒绝超大输入、取消与重试路径「不丢失工作、不重放不安全操作」。

权限分级、网络边界、输入边界、副作用可回放,一周之内三家头部工具都在加固同四面墙。agent 治理中间件正在从「值得做的假设」变成「行业默认动作」,这与前几周 Muse 越权、OpenHands 权限拆分、Copilot Studio 审批门的线索连成了完整的一条线。

结语:一个待验证的判断

把当天的信号收拢成一句话:成本与信任在同一个 24 小时里双向加速。DeepSeek 用 CED 架构改写长上下文的成本公式,Cognition 证明开源底座可以逼近前沿,三大工具同周修边界;而 OpenAI 的「不能排除」把数据回流从技术传闻变成公开指控。

留一个待验证假设:蒸馏取证类协议(如 prefill 归因)将在六个月内成为模型评测与采购的标准审计项。当天的证据链是:社区实验显示 Qwen3.8 对 GPT-5.5 Pro 推理前缀的 prefill 反应高达 +18 分(指向训练数据回流),Thom 指控证明数据回流无法自证清白,Cognition 也自述用「递归飞轮」加固验证器。若假设成立,下一个验证点将是主流评测机构把跨模型归因测试纳入公开方法论。

数据说明

  • DeepSeek V4.1-Flash 与 Cognition SWE-2 的基准分数均为厂商自报,截至发稿未独立复现。
  • OpenAI 数学成果归属争议为双方各执一词,无既定事实认定;Navier-Stokes 结论待数学界独立检验。
  • RSA-260 分解结果已经 FactorDB 数据库独立验证。
  • 事件状态:DeepSeek 价格与路由变更已官宣生效(09-14 截止);Cognition SWE-2 已在 Devin Desktop/CLI 可用。

延伸阅读:上一篇 AI 工程重心从聪明转向可控 记录了 Muse 静默失败与 Anthropic 降本指南,与本篇的治理线索一脉相承。