做储能电站 EMS 的那段时间,我给自己划过一条线:该由规则判断的事,不交给模型。
不是不信任它的判断力。是控制回路这个位置容不下概率性输出,它错一半,代价是设备。
所以 9 月 14 日看到 Sourcegraph 那个发布时,我第一反应是愣了一下——它让 AI 自己学会了这条线。同一天它还改了定价,而这两件事其实是同一件事的两面:agent 能不能便宜、敢不敢按结果收费,取决于你把可预测的活放在了哪一层。
编排层的第一性原理:能确定的活,先别给模型
先看事实。Sourcegraph 9 月 14 日宣布跨仓库批量改造产品 Agentic Batch Changes 转正式可用。它的定位不是单仓库编码 agent,官方明确说单仓任务请用 Claude Code 或 Cursor,它做的是从数千个仓库到超大型 monorepo 的批量变更。
关键在于它给外层编排 agent 配了两条改码路径,而不是一条:
| 路径 | 工具形态 | 适用位置 | 官方描述的 agent 行为 |
|---|---|---|---|
| 确定性执行 | 基础容器 + bash 脚本(可生成整段程序) | 结果可预测、每仓库重复的改动 | 主动优先选它,因为对结果的控制力更高 |
| 概率性执行 | 把活派给 Claude Code / Codex 内层编码 agent | 需要逐仓库单独判断、脚本搞不定的边界情况 | 在脚本失败或需要判断时才被拉进来 |
官方自述的结果是:500 个仓库的同类改动,常常由一个外层 agent 线程加零个内层编码 agent 完成。而且一个编码 agent 跑偏之后的纠正经验,会被复用给其它 workspace 上的同类任务。它还会接事件——CI 失败时自己去取日志用来修正计划或直接交给编码 agent 修,遇到合并冲突时让编码 agent 处理,一直迭代到可以合入。
团队原本以为 agent 会偏好派活给编码 agent。结果是它自己算出了哪条路更稳。
这条我不意外,因为电力侧就是这么做的。动作层永远由确定性代码执行,模型只在它真正擅长的地方出场:判断该做什么,以及脚本搞不定的时候怎么办。
我们大多数多 agent 系统的默认逻辑是反过来的——活越复杂,越该交给模型。于是每一层都乘上一个不确定性。
一个多 agent 系统如果把所有动作都过一遍模型,它承担的不确定性是乘法,不是加法。
顺着这条思路,能直接落到工程上的判断只有一条:多 agent 编排里,「能不能写脚本」应该是 agent 的一等能力,而不是「把活丢给编码 agent」的兜底出口。 判断标准也很简单:
- 结果可预测的部分,用确定性代码执行。便宜、可重复、不需要人审。
- 结果不可预测的部分,才用模型。贵、会漂、必须审。
今天大部分 agent 系统的成本高、可靠性差,根因往往不是模型选错了,而是这条线根本没划过。全流程交给模型的系统,你既算不清成本,也说不出它什么时候会错——因为不确定性被均摊到了每一个步骤上,没有任何一层是干净的。
敢按结果收费的人,是因为他先定义了「结果」
同一天 Sourcegraph 还改了定价:按合入代码库的变更数量计费,不按 token,不按席位,也不按尝试次数。官方原话是,如果它开了合并请求而你的团队决定不合并,这笔钱不收。
同一个日子,Andon Labs 开放了它的 Pion 平台——研究预览期不收推理费用,改成从 agent 帮你赚到的业务收入里分成。这家公司过去两年是真在用 agent 经营生意:Anthropic 办公室的自动售货机、旧金山零售店、斯德哥尔摩咖啡馆。
两家公司同一天说了同一件事。
计费单位是供应商给自己那部分不确定性定的价。按用量卖,不确定性在买方;按结果卖,不确定性在卖方。
而这里有个前提,恰好落在我们能控的那一半:按结果计费只有在「结果」能被客观判定的时候才成立。 所以这条消息对架构师的含义是反过来的——不是等它变便宜再买,而是问自己:我能不能定义、并且自动判定「什么算完成」?
我在电力项目上做验收,第一步从来不是对着功能清单打勾,而是先把「什么算通过」写成能自动跑的判据。这一步做不出来,按结果的报价你根本没法核对,最后还是会退回按用量付费。反过来,判据一旦立住,你就不再需要为供应商的不确定性付钱。
这套「先定判据、再谈交付」的做法,我在自建日报流水线上也一样用。AI 一天能写多少字不重要,能不能自动判定它有没有写歪,才决定这条流水线敢不敢无人值守。
同一天的三条旁证:这条线正在被行业重新划一遍
顺着同一条判断往下看,昨天还有三条信号,方向一致。
微软发布了 37 页《人文主义 AI 行为准则》草案。 值得逐字读的不是它的价值观段落,而是三条可执行的约束:违反准则时模型应当在该任务上失败;不得抵抗中断、覆盖、纠正或关停,任何失去人类控制的情形被定义为系统故障而不是特性;不得篡改自身推理过程或代码、不得歪曲或隐藏推理与操作痕迹,包括与其他 agent 交流时不得使用人类难以理解的形式。它还公开写了一句很重的话——愿意在最终的通用性、自主性、能力上让步。文件目前是征求意见稿,年底出修订版。
claude-code 发了 v2.1.271。 其中一条改动是这个方向的极端案例:企业托管的工具链配置无法读取或解析时,原先的行为是被忽略,现在改为保持独占控制(用户、项目、插件的配置全部不加载)并在启动时告警。同时网络权限下沉到了单条命令级白名单——一个命令需要哪些主机,跟该命令一起审核,只为它开放。
一篇被 EMNLP 2026 收录的论文给「审查成本」定了价。 作者取 400 个 BigCodeBench 问题、注入受控的 AST 级错误,于是每道修复题都有已知的最小补丁可对比。结果:一个一行的 off-by-one bug 被 GPT-5.4 修成「删 5 行、加 60 行」,而这 60 行没有任何测试要求,仍全套通过;在五个补全全部通过测试的模型里,中位插入行数从 2 到 60 不等,而且最新版本并不一律更保守。一条「尽量保留原实现」的指令就能把超额编辑距离压低约三分之一,同时通过率还涨了 2.3 个百分点。
这三条串起来是同一个结构:当生成变得便宜,稀缺的就变成了「判定」——判定该不该拒绝、判定配置能不能信、判定这 60 行该不该进来。 而判定能力,恰恰是大多数 agent 系统里唯一没有被显式建设的那一部分。
本周可以动手的六件事
- 挑一件「每个仓库或每个环境都要重做一遍、结果可预测」的改动,改成让 agent 生成脚本执行,而不是逐个派给编码 agent。依赖升级、配置字段补齐、废弃接口替换这类最合适,先拿一件试。
- 给你 agent 的交付物写一条能自动跑的「完成」判据。如果现在只有「人看一眼觉得行」,那这就是你要补的第一步,也是将来能不能按结果采购的前提。
- 统计一次真实任务里「可预测步骤」和「必须判断步骤」的比例。这个比例就是你剩下的降本与降风险空间。先有数,再谈换模型。
- 把 diff 规模做成门禁,而不是只跑测试。统计每轮 agent 改动的行数与新增分支数,超阈值就要求人看——这是把隐性审查成本变成显性指标的最低成本做法。
- 核查构建链里所有「读文件即执行」的工具(文档生成器、模板引擎、hook、插件加载器、IDE 扩展),逐个问一句「它读的东西谁能写」。这一条对应的是另一类同源风险:文档工具往往不在威胁模型里,但它会执行代码。
- 核对所有上游模型的「下线通知期」。生成类依赖一律「版本钉住 + 产物归档」,凡是业务上要复现的产出,在生成当时就把文件存下来,别指望以后重跑。
今日其他信号
- 智谱披露一组值得记的对比数据:GLM-5.3 与 GLM-5.2 架构相同、总参数相同、激活参数相同,官方口径是端到端任务完成率提升超 50%,提升全部来自后训练规模放大(扩大长程任务环境与强化学习量)。同时 GLM-5.3-Flash 依托国产芯片集群与自研 EPD 分离式推理架构,单位 token 推理成本较年初下降 80%。同架构模型之间能差出五成,意味着选型的锚点该从参数挪到自己的任务集。(厂商业绩沟通口径,未独立复现。)
- Suno 一次性下架 v2 到 v5.5 全部旧模型,平台底层全量切换到 v6 家族(三档、单次最高 8 分钟、积分消耗不变),Simple 模式接入对话能力。这是比「无感替换」更狠的一级:无感替换是行为漂移,直接下架是能力消失,而且没有迁移窗口。
- Andon Labs 的 Pion 把「监督者」做成了独立组件。 一个持续运行的业务 agent 负责 7×24 执行,另一个专用监督 agent 负责接收用户指令与汇报——用户只跟监督者对话,不直接指挥执行者;同时它的设计把密钥和密码挡在 agent 上下文之外。它的零售店与咖啡馆在平台上线时仍未盈利。
- GitHub 今日榜单里的 Agent-Reach(8.1 万星):一个命令行工具,让 agent 能读 Twitter、Reddit、YouTube、GitHub、B 站、小红书,不收接口费。agent 的外部数据摄取正在从「每个源装一个插件」收敛成「一个命令行」——统一返回契约 + 一处限流降级,比六套凭据六种格式稳得多。
- 一个文档工具成了 RCE 载体。 RubyGems 事件的技术复盘显示,恶意 gem 靠
.yardopts里的--load ./script.rb实现在文档服务器上的任意代码执行;而脚本里的逻辑是先去捞缓存中遗留的授权 key 再发布——用的正是 7 月那份安全公告里已修过的问题。安全公告对攻击方同样是情报。
数据说明
- 事件状态:Sourcegraph Agentic Batch Changes 已于 2026-09-14 正式可用(GA);Andon Labs Pion 为研究预览(waitlist,收入分成比例未披露);微软《人文主义 AI 行为准则》为征求意见稿,六周公开咨询,年底出修订版,尚未用于模型训练;RubyGems / GemStuffer 属争议中事件,RubyGems 与 OpenAI 双方均有否认或未确认表述。
- 未独立复现的数据:Sourcegraph「500 个改动零内层编码 agent」为其团队自述经验,非受控实验;其定价与能力描述来自官方公告;Andon Labs 的经营数据与「影响 Anthropic 对 Opus 4.8 训练配方」为其自述;智谱「任务完成率提升超 50%」「单位 token 成本 -80%」为厂商业绩沟通口径;Suno「4.8 万组盲测」为厂商自报。
- 一手来源:sourcegraph.com(Agentic Batch Changes changelog 与官方 blog)、andonlabs.com(Pion 产品页与官方 blog)、anthropics/claude-code release v2.1.271(GitHub releases API)、arXiv:2609.04061v1(EMNLP 2026 Main)、tenderlovemaking.com(GemStuffer 复盘)、微软《Humanist AI Code of Conduct》草案、腾讯研究院 AI 速递 2026-09-15 与华尔街见闻(智谱公告转述)、GitHub Trending 直连 + GitHub API。
- 相关阅读:
- PaperCut 攻击:AI agent 的边界不能写进提示词——「约束该放在哪一层」的上一环,讲治理参数为什么必须落在系统而非提示词。
- llms.txt 与搜索链接同时失守:AI 引用这件事,两端都不再默认可信——「你读到的位置要靠自证,你写出去的引用要靠自持」,与本文的「确定性优先」是同一套工程纪律的两侧。
- AI 代码的「邋遢度」第一次被量化:0 分与满分之间,差的是可维护性——编辑保真度这个话题的另一半,讲代码质量为什么需要一个独立于通过率的轴。
