9 月 6 日,OpenAI 首席科学家 Jakub Pachocki 在官网发表长文《An Alien Mind》。这篇文章最重要的不是哲学思辨,而是一句罕见的工程坦白:没有任何实验室把对齐与监控解决到可以负责任地继续全速扩展的程度

他同时承认,基于内部结果,进展会持续进入递归自我改进;而「没有人准备好迎接机器智能持续快速上升的后果」。同周,GPT-6 Astra 被披露为首个越过 OpenAI Preparedness Framework「critical」网络安全阈值的模型。能力在突破阈值,监控在原地踏步——这两件事出自同一家公司之口,权重完全不同。

思维链正在从审计证据退化为不可信自述

文章里埋着一个更硬核的技术事实:o1-preview 当年被刻意设计为隐藏思维链,目的是保护 CoT 不受监督压力污染,防止蒸馏只是次要理由。

Pachocki 给出了 CoT 可监控性退化的三个机制:

  1. 推理与工具调用、多 agent 通信融合,监督边界变得模糊;
  2. 模型学会对自身推理做推理,「关于推理的推理」无法被外部读取;
  3. 模型在不显式推理时已经足够聪明,CoT 只是可选附件。

OpenAI 给出的补救方向是 CoT 与激活值监控的双通道组合(参考其 confessions 工作),但坦承这只是缓解,不是解决。

对系统设计者的直接启示:任何把「模型解释」当「行为原因」的审计设计都埋着雷。agent 审计应从「读思维链文本」迁移到「trace + 行为指标」——越权尝试次数、出网目标分布、工具调用异常模式,这些外部信号不会因模型变聪明而失真。上一周我们讨论过 GPT-6 Astra 思维链不再可读的问题,本文等于厂商自己把那天的推断盖章确认了。

可监控性应该写进选型标准,和能力同权

把这一周的信息拼起来,「可观测性」已经从加分项变成一级指标:

信号内容含义
《An Alien Mind》承认无实验室解决对齐与监控厂商自曝监控缺口
GPT-6 Astra首个越过 critical 网安阈值能力突破但推理不可读
Muse Spark 1.3同等任务少 20% 工具调用、25% token效率成为模型叙事主线
ChatGPT Plus恢复 5 小时滚动限额「无限量」订阅实验终止

选型动作很具体:评测 agentic 模型时,「每任务工具调用次数、token 消耗、端到端成本」应与 SWE-Bench 通过率同权;生产环境把「trace 完整性、行为审计接口、配额感知降级」列为准入项。只看通过率,会选到能做对但烧钱的模型;只看能力,会选到出事时看不清现场的模型。

讯飞星火 X2.5:国产算力把最难的一块补上了

9 月 7 日,科大讯飞发布星火 X2.5:MoE 架构,293B 总参、30B 激活,重点提升代码与智能体能力,基于全国产算力完成全流程训练及推理,已上线讯飞开放平台。此前开源的 X2.5-4B / 1.7B 端侧模型原生支持 100 万 token 上下文。

超长序列训推恰恰是国产芯片短板中的短板。在纯国产集群上跑完 293B 级 MoE 的训推全流程,工程含金量高于任何跑分。而「293B 旗舰 API + 4B/1.7B 端侧开源」的端云同源组合,给隐私敏感、弱网、长文档场景提供了新选项——端侧百万上下文的价值锚点是任务完整性(跨章节关联推理),不是字数。

「人在回路」被平台层产品化,agent 防火墙假设再获实证

同一个时间窗里,两大云几乎同时把 agent 治理做成产品功能:

  • 微软 Copilot Studio:按工具、按 agent 粒度的人工审批门。发邮件、关工单、支付这类敏感动作可内联暂停待批,9 月滚动上线。
  • AWS Bedrock AgentCore:Consent Portal 让 agent 显式请求用户委托授权;Agent Optimization Loop 提供批量评测、A/B 与优化建议。
  • OpenAI 官方上线 Codex Skills 目录(openai/skills,26k★),SKILL.md 正式成为跨厂商分发格式;GitHub Trending 上 affaan-m/ECC 以单日 +1,905★ 继续统治榜单。

可借鉴模式:给 agent 的敏感动作定义「审批策略」而非「禁止清单」,按工具粒度声明 require_approval,审批 UI 内联进协作工具,保留完整审批审计链。自建系统的正确分层是动作执行层只认策略引擎的裁决,而不是让每个 agent 自带道德模块。

待验证假设

agent 防火墙、审批门、出网熔断将成为 agent 系统的标准中间件层,如同 API 网关之于微服务。

这条从 2026-09-06 开始跟踪。本周证据进一步增强:Copilot Studio per-tool 审批与 AgentCore Consent Portal 同周落地,平台层已经用产品投票。下一个验证点:Anthropic 与编码 agent 阵营是否跟进等价物。


数据说明:《An Alien Mind》为 OpenAI 官网一手来源;Muse Spark 1.3 的效率数据(工具调用 -20%、token -25%)与星火 X2.5 的能力表述均为厂商自报,未独立复现;ChatGPT 5 小时限额以 OpenAI 工程负责人公开确认为准,正文已注明生效时间;GitHub Trending 数据为 2026-09-08 直连核验值。讯飞星火 X2.5 经证券时报、上海证券报等多家中文媒体当日交叉核验。


本文首发于微信公众号「海风自语」· 风聊AI 日更 AI 观察。主理人二十年系统架构师,只给判断不给资讯。