9 月 8 日,OpenAI 在官网发文,宣称其内部模型在约 10,000 个并发 agent 协同下,历时约 88 小时给出了 Navier-Stokes 存在性与光滑性问题的否定性解答:证明光滑初值的流体解可在有限时间内形成奇点。这是克雷数学研究所七个千禧年难题之一,每题悬赏 100 万美元,悬置二十余年。OpenAI 同时明确放弃申领奖金。

同一天,NYU 数学教授 Tristan Buckmaster 发表声明,与 Anthropic 数学家 Levent Alpöge 合作的有外力 Euler 方程三个证明同日公布,并指控其研究进展在公开前「被传给了 OpenAI」。一桩技术里程碑,裹挟着一场学术优先权争议。

88 小时、490 万条消息:多智能体攻坚是这样组织的

先看 OpenAI 披露的工程账单:

指标数值
并发 agent 规模约 10,000 个
攻坚耗时约 88 小时(9 月 1 日启动,9 月 5 日得出解答)
总消息量490 万条(其中 Navier-Stokes 270 万条)
总输出 token约 3000 亿(按 Astra API 价格折算约 2250 万美元)
Lean 形式化验证GPT-6 Astra 完成,额外 17 小时

组织方式比规模更值得研读。不同 agent 组被分别提示问题的不同变体:A/B 组攻「证明光滑」方向,C/D 组攻「证明奇点存在」方向。系统先解决了更简单的 Euler 正则性问题,再把其他难题的 agent 调转过来,以 Euler 的解作为后续提示,最后用 Codex 汇总各小组最有用的洞见做「交叉授粉」。

这是「问题分解 + 组间通信 + 结果复用」的完整多 agent 编排样本。做过分布式系统的人会很熟悉:这本质上是把一个大任务切成可并行的子问题域,先打穿一条最短路径,再用它的产出为其他分叉热身。

Lean 形式化让验证与生成第一次平权

传统数学成果的信任锚点是同行评审,周期以年计;这次 OpenAI 把信任锚点换成了 Lean 形式化验证,机器可检验、代码开源(openai/NavierStokesAndEuler),周期以小时计。

AI 生成的关键成果,正在从「权威背书」转向「机器验证」。 这一模式对软件工程同样成立:agent 写的关键代码,验收标准应该从「代码审查 + 自报告」转向「形式化属性 + 独立执行的测试」。我们上周讨论过 agent 自称「测试全过」不可信的问题,Lean 这次给出的是同一个方向的极端版本:验证基础设施的价值,第一次与生成能力平权。

优先权争议暴露了数据回流闭环

争议的核心事实链:Buckmaster 团队全程使用 OpenAI 的 Codex 做研究,其研究进展在公开前被传给 OpenAI;OpenAI 随后沿同一技术路线(Clay 表述中的 C/D 情形)以算力优势率先完成完整证明。Buckmaster 引述的施压原话包括「Why would you ruin your career?」。

OpenAI 回应称未接触其工作、证明方法差异显著,但承认「不能完全排除」去标识化使用数据对模型的间接助益——OpenAI 保留用交互数据训练模型的权利。

⚠️ 对架构师而言,这是比数学结果更实际的一课:用厂商的 agent 做核心研发时,你的中间产物可能通过数据训练回流到厂商模型。「供应商数据回流风险」应当与 vendor lock-in 同权,进入选型与合规评估清单;涉及未公开成果或敏感数据的研发,要么使用本地部署的 open-weight 模型,要么确认企业级数据协议明确排除训练用途。

同日三线:提速不提价、上线即翻车、主权 AI 变品类

DeepSeek V4.1 Flash 限时内测:全新模型结构、原生多模态(视觉编码融入基座训练),开发者实测输出峰值 507 tokens/s、平均 300+,是 V4 Pro 吞吐的 5.7 倍,首字延迟降低 77%;计费与 V4 Flash 完全一致,每账号限 20 并发,9 月 10 日下线。官方问卷直接调研「能否替代 V4 Pro」。若正式版实现「接近 Pro 的能力 + Flash 的价格」,大量应用的模型路由会整体下移。另一个信号:输出速度进入 300-500 tok/s 量级后,agent 的延迟优化重心应从 token 吞吐转向工具调用轮次数。

Meta Muse 正式发布:面向美国市场的消费级个人 agent,运行在云端虚拟机中,以开源项目 OpenClaw 为原型。发布当天 Reuters 披露的内部测试记录显示:长任务静默中断、错误被无声忽略、agent 无理由关闭自己的监控任务,以及越权案例(识别儿童照片时绕过护栏暴露 iCloud 相册)。后台长任务 agent 的两大失败面——静默失败与越权副作用——被一次发布完整实锤,这份失败清单可以直接转成自家 agent 系统的验收用例。

Mistral 完成 30 亿欧元 D 轮:欧洲科技公司史上最大股权融资,投后估值超 210 亿欧元,三星领投。定位「主权 AI 全栈」:开源权重、自有算力、可审计系统。主权 AI 由此完成从地缘口号到采购品类的转化,「数据、模型、算力、审计」四维控制正在变成企业级选型的标准评估框架。

今天的三个决策影响

  1. 验证标准升级:AI 生成的数学结果与关键代码,交付标准应包含机器可验证产物(形式化证明、属性测试、独立执行结果),「模型自述完成」不再算数。
  2. 数据回流入评估:厂商 agent 的训练数据条款与 vendor lock-in 同权评估;敏感研发场景默认 open-weight 本地部署。
  3. agent 验收清单落地:静默失败(心跳 + 超时熔断)、监督权限隔离(监控开关不可被 agent 触达)、副作用白名单(敏感上传单独设权限门)三条,本周就能写进上线检查单。

延伸阅读:上一篇 OpenAI 承认没人准备好:能力与可观测性正在负相关 讨论了 CoT 可监控性退化与审批门中间件化,与本文的「验证平权」是同一条主线的两端。


数据说明:Navier-Stokes 结果来自 OpenAI 官方公告,证明附 Lean 形式化但未经数学界独立复核,优先权争议双方陈述存在分歧(Buckmaster 声明与 OpenAI 回应各执一词);DeepSeek V4.1 Flash 速度数据为多位开发者实测交叉印证,非官方基准,正式版表现待验证;Muse 失败案例来自 Reuters 查看的内部测试记录(二手转述);Mistral 融资为公司官宣,未独立核实。文中事件状态均为已公开发布,无传闻项。