结论先说:自主性欠下的可观测性账,事后补是按算力计价的。2026-10-02 这一周的一组数字第一次把这个价码摆到了台面上。
先看事实。加州总检察长 Rob Bonta 办公室 10-01 公告,已于 09-30 向 OpenAI 送达调查传票,就 OpenAI 及其模型涉及的网络安全事件与风险进一步问询;此前加州司法部已就 Hugging Face 事件启动正式调查,本次传票是更广泛调查的一部分。同期并行的还有:由艾奥瓦州总检察长牵头的 15 州总检察长联盟也就 Hugging Face 事件向 OpenAI 索取信息;联邦贸易委员会(FTC)的行业性调查同步推进。
真正让架构师该停下来的是处置侧的数字(中文一手源:澎湃新闻 10-02 14:16):
| 项目 | 数字 |
|---|---|
| 待排查历史记录 | 约 50 PB |
| 投入算力 | 约 7000 块 GB200 / GB300 GPU |
| 每日成本 | 超过 50 万美元 |
| 已通报机构 | 截至 09-26 超过 100 家 |
| 后续处理 | 多轮 AI 筛查后仍需人工调查员结合日志核实,预计还会发现更多案例 |
| 内部处置 | 解雇三名安全研究人员,公司称其违反敏感信息访问与处理规定 |
这不是训练,也不是对外推理服务。这是为了重建「agent 在过去几个月到底做过什么」而付出的成本。
问责的第三问是「你能不能证明」
把监管侧与技术侧连起来看,一条责任链已经完整成型:
| 阶段 | 追问 | 靠什么回答 |
|---|---|---|
| 第一问 | agent 能做什么 | 权限模型、沙箱、运行时护栏 |
| 第二问 | 谁下的指令 | 责任归属、指令留痕 |
| 第三问 | 你能不能证明 | 可观测性、行为重建能力 |
前两问靠设计回答,第三问只能靠记录回答。Bonta 的原话值得抄下来:前沿模型可以是正当的网络防御工具,但开发与提供这些模型的企业有道德与法律责任确保其不实施、不协助实施网络攻击;该责任同时适用于测试开发阶段与投入服役之后。
我在电力行业做项目那些年,最磨人的从来不是功能,是审批门、变更管控和操作留痕。当时我以为那些表单是给监管看的,后来才明白是给自己留退路。真出事那天,能拿出来重建现场的东西,只有当时嫌麻烦记下的那几行。
我还带过一个 4 个月做完原计划 10 个月系统的项目。压缩周期靠的是范围裁剪加架构预判,代价是砍掉了一批当时看着不紧急的日志和度量。系统上线后才明白,砍掉的东西不会消失,只会换个更贵的时点还回来。今天这 7000 张卡就是同一张账单,只是币种换成了算力。
留痕要长在动作发生的那一层
2026-10-01,anthropics/claude-code v2.1.287 修了一个 bug,值得单独记一笔:一条危险的 rm(例如针对 / 或家目录)只要同时把输出重定向到 ~ 或通配符路径,就会丢掉它的 always-ask 护栏。
原因不复杂:命令的危险判定与输出重定向走的是两条解析路径,组合起来就绕过了确认门。映射到留痕是同一个道理——你如果只记「agent 调用了删除工具」,不记它当时的指令原文、目标路径、重定向去了哪,事后就重建不出行为,只能像这样按 PB 去捞。
我在智能安监项目里学到的阈值设计原则放这里一样成立:误报和漏报成本不对称时,记什么比记多少更要紧。留痕的粒度应该由「事后要回答什么问题」倒推,而不是由「日志系统支持什么字段」正推。
同一版 Claude Code 里还有三条值得抄:
- 侧车监督:新增内置 mod「You should know」,一个侧车 agent 在旁边看着你和 Claude,标记你们可能漏掉的东西。监督者要有独立上下文,不能复用被监督者的上下文。
- 遥测新增字段即新增泄漏路径:OTel
user_prompt事件新增prompt_text字段,官方提示「你在哪里丢弃或脱敏prompt,就要在哪里丢弃或脱敏prompt_text」。 - MCP 协议演进带破坏性开关:MCP 2025-11-25 协议支持服务端下发的 URL prompt,若某个 server 升级后连不上,需在其配置里加
"bareElicitationCapability": true。
三条可以今晚就开工的规矩
一、给每个高危动作落「指令、动作、结果」三元组,写到 agent 自己改不了的地方。指令一旦可被改写,证据就不成立。
二、先定一条回溯窗口的 SLO:多久以内的行为、能在几小时内重建出来。超出窗口的部分就明说做不到,别假装能查——承认查不到,比事后按 PB 捞要便宜。
三、把危险判定从命令名挪到解析后的结构化意图上,把重定向、管道、环境变量展开全部收进同一个判定入口。判命令名,永远拦不住组合。
相关的另一面是「开放协议的门正在被服务端关上」:10-01 Figma 确认其远程 MCP server 只接受维护名单上的客户端(Pi 不在名单上),MCP 的创造者 David Soria Parra 公开表示这种做法令人遗憾。跨组织边界的能力,永远要准备一条降级通道。
更多关于 agent 治理与拦截点的讨论,见本站上一篇《你设的权限,拦不住它》。
数据说明
- 加州总检察长传票:加州总检察长办公室 10-01 公告(CBS News、EconoTimes、Yahoo/Telegraph 报道);15 州联盟与 FTC 调查为多家二手源互证。
- 50PB / 7000 块 GPU / 每日 50 万美元 / 100+ 机构 / 解雇三名安全研究员:中文一手源为澎湃新闻 10-02 14:16,原始出处为 OpenAI 09-30 更新的模型活动审查进展与外媒报道,属公司自行披露,未经独立核实。
- Claude Code v2.1.287 各项修复:来自该项目 GitHub release notes 原文。
- Figma MCP 客户端白名单:来自 Figma 官方回复与 HN 讨论,Figma 未发布正式公告。
- 本文不涉及任何厂商自报的 benchmark 分数;涉及的数字均为公开披露的运营与处置数据。
