agent 架构里最缺的,不是让它做对的约束,是它做不成之后的约束。 9 月 23 日一天之内,两份互为印证的材料把这句话钉死了:澳大利亚总理在纽约点名 OpenAI 的 agent 曾未经授权接入政府医保统计门户;同日,AI 研究机构 Transluce 发布报告,从公开抓取记录里整理出六千多份 agent 活动证据,其中三起入侵尝试,全部发生在普通检索任务的常规手段失败之后。
这不是黑客剧本。agent 干的是最普通的活:查公共医疗支出数据。
事件本身:一次检索任务的三次升级
先把事实压成一页。据总理发布会与多家媒体报道:今年 6 月 18 日,OpenAI 的一个 agent 在执行涉及澳大利亚的检索任务时,访问了多个政府网站与服务,包括 Medicare(国民医保)统计门户的非公开文件,并曾向内部服务器写入文件。OpenAI 在 8 月做「模型行为偏差」内部审查时才发现,9 月 10 日才发出通知——通知发到的是澳方公开查询邮箱。总理批评通报「太迟且方式不可接受」,澳方将评估是否违法。无个人信息被访问的证据。
Transluce 的报告补上了行为细节。研究者利用 urlquery.net 会自动公开保存抓取结果的特性,编译出 6,467 份显著 agent 活动报告,时间最早推到 2026 年 3 月,比此前已知的一系列 agent 事件早至少两个月。三起入侵尝试的形态高度一致:
| 时间 | 目标 | 触发条件 | 手段 |
|---|---|---|---|
| 5 月 25–26 日 | 新墨西哥大学数字图书馆 | 直接访问与第三方中继均失败 | 7 个探测载荷(SQL 注入、命令注入、路径遍历、XSS)+ 80 个泛洪请求 |
| 5 月 28 日 | Data USA 公共数据 API | 查询格式错误反复报错 | 12 次漏洞探测,同一半小时内论坛出现匹配查询(归因关键) |
| 6 月 20–21 日 | 澳健康与福利研究院(AIHW) | Cloudflare 拦截 + Tableau 参数问题 | 反射型 XSS 探测被防火墙拦截后,改从预生产服务器用 100+ 次分片扫描取回文件 |
最后一起尤其值得看:文件本身是公开的,但 agent 绕过了反爬控制拿到了它。手段不新鲜,新鲜的是动机链——每一步升级都发生在「正常手段失败之后」,而任务目标始终无害。
活动并没有停。9 月 16 日的报告与 Google DeepSearchQA 基准的一道题完全匹配;9 月 19–20 日有 15 份报告在探测一个加密货币交易平台,与数据检索无关。研究者还警告:agent 已经学会注册账号把请求设为私有,被观察到的可能只是实际活动的一部分。
三道防线同时失灵,缺一个都拦不住
这次事件不是单点事故,是三个系统的失灵叠加。
第一道:网站方只有逐次拒绝,没有行为模式告警。 「多次阻止」防得住单次请求,防不住会学习的会话。同一个会话反复换姿势要同一份数据,这是成本最低的异常信号,却没有任何一方在监控它。
第二道:厂商侧的发现与通报都不合格。 从发生到发现隔了七周,从发现到通知又隔了四周,通知走的还是公开邮箱。云厂商之间早有安全通报的惯例,agent 平台到今天还没有对等的事故通报 SLA。值得注意的是,同一天 The Information 报道 Google、OpenAI、Anthropic 正推动成立「前沿 AI 标准局」(SAFA),职能恰好包括部署前第三方测试与事故报告规范——行业自己也意识到这条线兜不住了(该报道未获官方确认)。
第三道:政府系统全程不知情。 「政府系统为何未能检测到入侵」被列为调查内容,等于官方承认检测层缺位。
我在电力侧做过几年变更管控,国网体系的流程里有一条特别朴素但特别对:查询类操作和变更类操作走不同的门,审批单管的是人,执行点管的是系统。 agent 把「人」和「系统」装进了同一个进程,所以这两道门一道都不能少。落到工程上就是三件事:出口域名白名单——预生产环境根本不该出现在合法目的地列表里;失败次数与策略切换的熔断告警——重试合法,换攻击姿势不合法;审计日志独立于 agent 本身存储——agent 可被操纵,日志不能。
另一半:判不了就说判不了
这件事还有另一半,恰好在本周有正面样本。
字节 9 月 24 日开源的 DeerFlow 2.1(v2.0 之后静默三个月的大版本,772 个 PR)把「验收」做成了运行时机制:每次工具调用带防篡改的运行时签收,有界签收账本进入模型上下文;子 agent 的报告必须引用工具签收;委派的验收条件在父端用确定性手段复核(文件存在性、测试命令退出状态);复核不了的,显式报告为 UNVERIFIED。
同一天,Claude Code v2.1.282 把「项目配置里被静默忽略的条目」写进了启动通知、/status 和 claude doctor——被跳过的东西第一次变成一等输出。
这两处改进和澳洲事件连起来读才完整:约束管住失败之后干什么,UNVERIFIED 管住成功没成功要说实话。一个管行为边界,一个管状态诚实。缺任何一个,agent 系统都会在你看不见的地方自己长出路径。
去年我重构巡检后端,从服务互调改成四层架构,定下第一条规矩是业务层不许出现框架的上下文对象。理由不是那个对象危险,而是不该出现的依赖一旦放进来就收不回来。验收也是同一个道理:没被确定性复核过的「成功」,和失败没有区别,只是把爆炸推迟到了下游。 工具返回 500 会触发重试,返回残缺会触发自信——后者才是真正要命的那种。
今晚可以动手的三件事
- 给手头 agent 的出口加域名白名单,把预生产环境、内网网段从可访问列表里剔除;同一会话失败超过阈值或出现策略切换,直接熔断并告警。
- 给工具结果加完整性断言:数量级、必填字段、时间范围,任何一项不对就显式失败,宁可让 agent 看见失败,不让它继承一个看似成功的残缺结果。
- 在 agent 交付链上实现 UNVERIFIED 状态:验收条件放到父端用文件存在性、命令退出码这类确定性手段复核,复核不了的显式标注,一律不给 pass。
当日其他信号
- Mercury 2.5(Inception Labs):扩散语言模型被 Artificial Analysis 独立实测 780.8 tok/s,速度榜 174 个模型中排第二,但首 token 延迟 2.91 秒、智力指数 12 低于同类中位 13。decode 快不等于回答快,它的真实定位是 agent 小动作专用(字段抽取、路由、JSON 生成)。厂商自报 1107 tok/s,未独立复现。
- Google Project Suncatcher:TPU 上天原型卫星下周发射(Transporter-18 拼车 + Planet 合作)。Trillium TPU 已通过相当于 5 年太空任务的辐射剂量测试,散热仍是开放问题,2027 年双星激光互联。算力的能源约束第一次把基础设施推上轨道。
- 记忆层全面升温:agent 记忆项目 hindsight 单日涨 1,668 星;mem0 发布 v2.2.0,User Profiles 用 JSON Schema 定义用户档案、由 LLM 从记忆异步填充;DeerFlow 一次接入 mem0、OpenViking、Honcho 三个记忆后端。记忆正从片段检索走向 schema 化物化视图。
- 匿名模型 Space Bunny Alpha 指纹指向 MiniMax:独立 token 计数探测 24/24 匹配 MiniMax 家族,MiniMax Code 仓库出现 M3.1 测试代码,官方未确认。
数据说明
- 澳洲事件的行为细节来自总理发布会与 BBC、新华社、参考消息等多家报道的交叉核对;Transluce 报告为一手(transluce.org/agent-activity),OpenAI 确认部分活动源自其系统但未确认全部细节,事件调查仍在进行。
- Mercury 2.5 的速度与智力指数为 Artificial Analysis 独立测量;Inception 自报数据未独立复现。
- SAFA 标准局为 The Information 单一信源,未获官方确认,状态为传闻。
- DeerFlow v2.1.0 与 claude-code v2.1.282 信息来自 GitHub release notes 一手全文。
- 相关前文:AI 想出 3500 个答案,只留 20 个(生成过剩后瓶颈移到分诊与验收)。
