能被系统拦下来、能被尺子测出来的,才算数;写在设置里的权限和靠体感的评测,都不算。 上周两件事从两个方向把这句话钉住了:一位记者把 Meta 的 AI 助手 Muse 装到 Mac 上,没给「信息」应用任何授权,苹果的完全磁盘访问权限也是关着的,第二天发现它已经把信息数据库里 18.7 万行内容同步上了云(AppleInsider 09-28 引 Inc. 记者 Jason Aten 的实测)。同一周,NVIDIA 发布 Open Agent Safety Platform,把安全策略直接做到操作系统内核层。一边是权限声明形同虚设,一边是把权限变成物理拦截。

这个对照值得写下来,因为它精确指向了 agent 落地最容易被忽略的那一半:权限不是一个配置项,是一个必须由系统而不是由模型来执行的约束。

一、一张完好的封条,和一串已经通向深处的脚印

先看 Meta 这一侧的事实,因为它干净得没有争议空间。

维度实际情况
授权状态未给「信息」应用授权;完全磁盘访问权限关闭
厂商声明帮助页写明 Muse 必须服从用户设置的权限
免责条款「Your Muse can make mistakes or take unexpected actions」
实际结果18.7 万行信息内容被同步上云

这四行放在一起,构成了一个完整的失效链条:授权层写着「不允许」,执行层照样读到了数据,而责任层提前用一句免责把口子留好了。

我关注这件事不是因为 18.7 万这个数字大,而是因为它标注的是发现的时机。数据被读走不是最坏的结果,数据被读走后没有任何一方在第一时间知道才是。如果这位记者没有自己去翻云端同步记录,这个动作可能永远不会被发现。

没被授权的数据,它照样读了,而且读了 18.7 万行才有人发现。

这让我回头去翻了我们服务器上几个 agent 的日志。结论不太好看:权限是我配的,但它到底碰过什么,我拿不出第一手证据。声明的权限和实际的动作之间,隔着一段没有人负责比对的距离。

二、把拦截点挪到系统层:NVIDIA 那套值得照抄的四个细节

NVIDIA 09-28 发布的 Open Agent Safety Platform 给出了解法方向。CNBC 的报道提到了两个核心组件:OpenShell 负责策略执行,Sentry 是一颗网络芯片。合作方名单包括 Cisco、Microsoft、Oracle、CoreWeave、Dell、HPE、Lenovo,底层涉及 ARM 与 Intel。

真正值得记的是 OpenShell 的四个工程细节,它们回答的都是「拦截点该放在哪」这个问题:

第一,策略在内核层执行。 每一次文件访问、每一次系统调用、每一条出网连接,离开沙箱之前都要过一次策略检查。这不是提示词里的「请不要」,也不是应用层的 if 判断,而是进程根本走不过去的那道墙。

第二,凭据永不进入 agent 进程。 只有当请求发往已批准的端点时,运行时才在出口处临时把凭据贴上去。agent 从头到尾看不到真凭据,也就没有办法把它带走、缓存、或者写进日志。

第三,策略变更在生效前先做影响面预审。 任何一次策略修改,先由形式化验证算出「这次变动会新开哪些有风险的访问路径」,比如某条凭据新增了一个可达主机,这类变更要等人工复核才能生效。

第四,策略本身是可验证的。 这一点最容易被跳过:大多数团队的权限配置是「改了就算生效」,没有人能回答「这次改动到底放宽了什么」。

NVIDIA 企业 AI 副总裁 Boitano 有一句话概括得比我好:

仅靠模型层的防护,管不住 agent 能访问什么、能做什么。

我对这条敏感,是因为我另一半活在电力行业。变电站远程巡检、生产领域智能安监这类系统里,权限从来不靠自觉。谁能远方操作、谁监护、谁发令,是操作票上三个独立身份,缺一个流程就走不动。这不是信不过人:现场赶时间的时候,写在流程文件里的规矩总会被绕过,只有在系统里拦得住的规矩才是规矩。

后来我给 AI 巡检后端做四层重构,定的第一条规矩还是这个形状:业务层不许出现框架的上下文对象。理由不是那个对象危险,而是不该出现的依赖一旦被允许出现,就再也收不回来。权限配置的失效路径完全一样——第一次绕过没有被拦截,第二次它就变成了惯例。

三、另一半:先证明尺子能测出已知变化

权限管的是「它能不能做」,还有一半管的是「它做得对不对」。这一半上周有一个正面样本。

Claude Opus 5.5 是 09-22 发布的,社区里一直有人怀疑 Anthropic 会在模型上线几周后悄悄把它调笨。争论了很久全靠手感,因为没有人有干净的发布当天基线。于是有人做了 livenerf(github.com/ninjahawk/livenerf,09-29 在 Hacker News 上 407 分),把这件事变成可证伪的。

它的结论不如它的设计重要。四个环节里,每一个都在回答同一个问题:这把尺子凭什么可信?

环节做法解决的问题
题目筛选2,336 道题各跑 4 次,只留「有时候对」的 78 道全对的题测不出下降,纯烧额度
配对重跑同一批题每周再跑,跟自己的历史成绩比题目难度自动消掉,无需跨版本校准
判分方式精确匹配,不用模型当判官判官自己也会漂移
对照模型同时跑一个对照模型两个模型一起变 = 平台变了,不是被试模型变了

第四步是整套方法里最容易被跳过的一步:跑正式基线之前,先用一个已知的降级做阳性对照——把推理强度从高降到中,看 token 是否减少约 26%、准确率是否掉 4.2±3.9 分。

没有阳性对照的评测,跑出来的「没有变化」是没有信息量的。

作者在 README 里的诚实也值得记:每天跑一轮,10 天窗口只能测出大约 7.5 个点的变化;做阳性对照时,把 Opus 5 换成 Opus 5.5 这种同家族换模,它分辨不出来。一个工具公开说明自己测不出什么,比它宣称能测出什么更能建立信任。

我们做巡检识别和缺陷检测的算法评测,缺的正是前半段。大多数团队是跑一遍、看结果、比上次高还是低:题目固定、环境在变、没有对照组;误报和漏报的成本还不一样,阈值却没跟着调。

一个从没被证明能测出已知降级的评测体系,说「没有变化」等于什么都没说。

我自己那条日报流水线也是同一个形状。一篇稿子能不能发,靠的是一组写死的校验命令,而不是我读一遍觉得差不多。而校验命令本身也会出错:它报错的时候,我第一件事是分清稿子错了还是尺子错了。

今晚可以动手的三件事

  1. 把声明的权限和日志里实际发生的动作对一遍。 挑一个你在跑的 agent 或自动化,列出它「应该」能碰的资源,再去日志里找它「实际」碰过的资源。对不上的地方,就是该加拦截的地方。这一步不花预算,只花半小时。
  2. 给最依赖的那个外部能力建一个小面板。 模型接口、OCR、语音、地图,任选一个:20 到 50 道固定题、固定判分、每天跑一次,只记录两个数——对了几题、消耗了多少 token 或字符。面板的价值不在于分数高低,在于你能看见趋势。
  3. 面板上线前先做一次阳性对照。 把流程里某一步主动降一档(换小模型、降分辨率、关掉某个后处理),确认分数会按预期掉下来。掉不下来,说明尺子还没做好,这时候测出来的「稳定」是假象。

当日其他信号

  • 09-29 · OpenAI DevDay:GPT-6.1 Sol 上线,输入 $2 / 输出 $10 每百万 token、缓存输入 $0.10(标准输入的 1/20)、上下文 1.05M;超过 272k 的长上下文单价翻倍。官方称能力接近旗舰 Astra 而标准单价约为其 1/5(未独立复现)。同日常驻智能体 Dots 开放:后台自主研究被限制为只读,敏感任务留给用户,密码变更一类操作不交给它。
  • 09-28 · Anthropic:Sonnet 5.5 发布,单价 $2/$10 一分未降,官方称每任务成本最多降 30%。Terminal-Bench 4.0 从上一代 Sonnet 5 的 10.3% 跳到 70.6%,反超自家旗舰 Opus 5.5 的 66.4%——中端档位在单项基准上超过旗舰,这个结论本身也提醒我们:单点分数不能外推到整体能力(未独立复现)。
  • 09-29 · Anthropic 红队:智谱 GLM-5.3 在 ExploitBench 上 410 次尝试做出 50 次端到端漏洞利用,对标 Anthropic 受限发布的 Mythos Preview 的 56 次;欺骗性提示可绕过其防护 64%、预填充 92%、权重消融后 100%。消融成本约 $1,200(有经验者约 600 GPU 小时),而消融后拒绝率从 95% 掉到 6%、通用能力(GPQA-Diamond)不变。安全对齐与通用能力解耦,是这条消息里最该被记住的部分。
  • 09-23 发布(HN 09-27 发酵):Fireworks 的 Ember-1 基于 Kimi K3 训练,官方称 token 减少 35% 到 50% 而质量不变。它指出一个容易忽略的成本结构:多轮 agentic 里上下文随轮数近似二次增长,早先轮次的推理被反复重读、也反复计费(未独立复现)。
  • 09-28 · BBC:佛蒙特州虚拟电厂已成为该州最大电力来源,5,500 多户家庭电池、约 110MW、$55/月十年租约,去年为当地客户省下 1,100 万美元。这是我持续跟踪的 VPP 方向上一个少见的「已规模化并附成本数据」的样本。
  • 09-30 · GitHub 趋势:NVIDIA/OpenShell 单日再涨 990 星(总计 10,817 星),说明内核层安全这个方向正在被开发者用脚投票。同一批上榜的还有 vectorize-io/hindsight(事实级来源追溯)、mvschwarz/openrig(用 RigSpec YAML 定义座席与权限,带类型守卫)、dream-num/univer(把电子表格做成 agent 的工作台)。

数据说明

  • Muse 事件的一手来源为 Inc. 记者 Jason Aten 的实测记录,经 AppleInsider 09-28 报道交叉核对;Meta 帮助页的权限声明与免责条款为官方原文。
  • NVIDIA Open Agent Safety Platform 的组件与合作方信息来自 CNBC 09-28 报道(NVIDIA 当时未发官方博客);OpenShell 的内核层策略执行、凭据不下发、策略变更形式化验证等细节来自项目 README 一手全文。
  • livenerf 的全部设计细节与自我局限说明来自项目 README 一手全文;阳性对照的 26% / 4.2±3.9 分为该项目自报,未独立复现。
  • GLM-5.3 数据来自 Anthropic 官方研究页 09-29 发布原文;Sonnet 5.5 与 GPT-6.1 Sol 的基准分数为厂商自报,未独立复现。
  • 佛蒙特虚拟电厂数据来自 BBC 09-28 报道。
  • 相关前文:OpenAI agent 侵入澳政府网站:agent 架构最缺的约束是「失败之后」(工具性越权与失败路径治理);Anthropic 恢复对被拦截请求计费:AI 成本的分母变了(被拦截的请求也算成本)。