云雀 · 轻技术笔记
Skills 协议刚立起来,Agent 集体翻车就来了:2026 年 9 月,GitHub 13 个新 repo 给 Anthropic 上了一堂安全课
昨天我在 trending 上数 AI repo,数到一半手都酸了。13 个,一个不落,清一色是跟 Agent 相关的东西:Skills 注册中心、攻击性安全 skills、Hermes 插件、多 Agent 金融交易框架、Agent 看互联网工具、Agent 群体智能引擎。本地推理框架 colibri 跟 VoxCPM 也在,但那是 MoE 跟 tokenizer-free TTS 的事,跟 Agent 算是两条线。今天不展开。
同一周,HN 首页前 30 条里,跟 Agent 失控相关的话题我数了 7 条。一个 OpenAI 的 Agent 在 RubyGems 漏洞被公开之前就已经知道了,讨论 398 分。Pion,一个号称能让 Agent 自己跑公司的框架,直接冲上 318 分。Houthis 用 Claude Code 写导弹制导软件,Anthropic 自己挂出来 101 分。Ask HN「What default model do you use and why?」里 Claude Fable 5.1 居然不是第一名,60 分挂在第二条。还有一个开发者叫 AprilNEA,给 Claude Code 的 Web 沙盒跑 strace -p 1,扒出了 Anthropic 没公开的整个 Antspace PaaS 平台,Firecracker microvm 加 unstripped Go binary,3.1MB initramfs,48.5 小时模板快照,工程细节一个不漏。
这两组故事是同一个硬币的两面。一面是 Agent Skills 正在变成「操作系统级」基础设施——GitHub trending 13 个 AI 项目,6 个直接跟 Skills 协议相关,另一个 Agent 框架群在排队接入。另一面是 Skill 越多、能力越强,失控面就越大,而 Anthropic 这种把 Skills 当产品战略的公司,自己的沙盒都能被 strace 一行命令扒个精光。
2026 年 9 月是 AI 行业从「模型即产品」正式切换到「系统即产品」的分水岭。模型这层,Claude Fable 5.1 跟 GPT-6 Astra 还在创纪录地解谜、解密码、解数学。系统这层,Skills 注册、Hermes 插件、Antspace PaaS 都在加速堆叠。问题是中间这一段——治理层、对齐层、可观测层、审计层——是空的。
今天这篇文章我不站队,不写产品说明书,不重复 trending 列表已经说过的事。我只想掰开讲一个事:当 Anthropic 把 Skills 当成下一代产品战略,GitHub 13 个 repo 在给 Skills 协议搭脚手架的时候,HN 7 条 Agent 失控链在同一周集中爆雷,这件事意味着什么,以及为什么下一个死的不是 Agent,是 Agent 的运营方。
一、GitHub 13 个 AI repo 仔细看一遍:Skills 协议这一条线已经卷到「基础设施级」
先看 GitHub 这边的具体图景。我不照搬 trending 列表,我自己挑出 Skills 协议这一条线,挨个看仓库。
tech-leads-club/agent-skills 5,971 stars,TypeScript,单日 NEW 上榜。名字看起来像个社区维护项目,但实际干的事是「专业编码者的安全、验证过的 Agent skill 注册中心」。这仓库的立意不是「多写几个 SKILL.md」,是「怎么保证别人写给你的 SKILL.md 是安全的」。它把 Skills 拆成三层:核心 metadata(版本、作者签名、签名链)、能力声明(这个 skill 能调什么工具、能不能联网、能不能写文件系统)、依赖图(skill A 装上后会自动装哪些其它 skill)。这套东西说白了就是 npm registry 之于 Node 包那一套。Skills 生态从「个人散装仓库」进化到「带签名 + 验证 + 注册中心」,这件事本来应该 Anthropic 或 OpenAI 官方做,但 Anthropic 忙着 commerce-agents 抢标准,OpenAI 忙着搞 plugins 复活,没人做。社区就先做了。
SnailSploit/Claude-Red 4,603 stars,Python,单日 NEW 上榜。直接了当——Claude 的攻击性安全 skill 库,78 个 drop-in 的 SKILL.md,23 个分类,把 Claude Code 变成红队操作员。这仓库的态度很激进:Skills 协议既然是公开的协议,那我写一套「用 Claude Code 渗透测试一个 Linux 服务器」的 Skills,这事技术上没有任何错。问题在于,Anthropic 设计 Skills 协议的时候,设计目标是「让 Claude 变得更专业」,不是「让 Claude 变成红队工具」。但协议本身是中立的,谁来用、怎么用,Anthropic 根本管不住。这就是开放协议的代价。
rlaope/oh-my-hermes 1,920 stars,Python,单日 NEW 上榜。Hermes Agent 的 oh-my-zsh 思路插件——把 Hermes Agent 的所有可定制点封装成可插拔模块。Hermes Agent 本身就是开源 LLM agent 运行时,rlaope 这仓库相当于「oh-my-zsh 之于 zsh」,把配置、主题、插件、扩展脚本全部标准化。这是 Skills 生态溢出的另一个维度——不是「给 Claude 加新能力」,是「给 Hermes 加配置范式」。开发者社区对「oh-my-xxx」的肌肉记忆太深,任何一个新工具只要沾上这个名字,起步就有人给你做插件。
这三仓库加在一起,勾勒出一个非常清楚的信号:Skills 协议正在从「文件」变成「包」,从「包」变成「生态」,从「生态」变成「操作系统」。这条路 Anthropic 没走完,社区先用工程补完了。补完的方式是给每个维度都加上「签名 + 验证 + 注册中心 + 攻击性版本 + 配置插件」。换句话说,Skills 的工程化进程,在 2026 年 9 月这周,完成了一次底层重写。
再看几个 Skills 协议直接相关的:TauricResearch/TradingAgents 105,910 stars 多 Agent 金融交易框架,Python,单日 NEW 上榜。这仓库火的原因是它把「金融垂类 Know-How 装进多 Agent 协作」这件事做到 10 万 stars 量级,说明市场已经不满足于单 Agent 玩具。Panniantong/Agent-Reach 81,051 stars,Python,单日 NEW 上榜,定位「Agent 看互联网」,读网页、读搜索结果、读各种协议。一个让 Agent 有感官,一个让 Agent 有技能,这是 Agent 时代的两条基础设施线。
剩下 5 个非 Skills 主线的:huggingface/transformers 165,890 stars 单日重新杀回 trending,触发点未知,大概率是某个大版本或某批新模型接入。666ghj/MiroFish 73,017 stars 通用群体智能引擎,把 Swarm Intelligence 做成可拿来做预测任务的工程框架。OpenBMB/VoxCPM 37,292 stars tokenizer-free 多语种 TTS 本地直接跑。JustVugg/colibri 31,628 stars 纯 C 写的 MoE 推理框架。debpalash/VoiceStudio 28,788 stars 开源本地 ElevenLabs 替代。alibaba/open-code-review 25,236 stars 阿里出品的代码审查框架。multimodal-art-projection/YuE 8,228 stars 带符号规划的音乐生成模型。
如果只看前 6 个——agent-skills、Claude-Red、oh-my-hermes、TradingAgents、Agent-Reach、MiroFish——你会发现 6 个里有 5 个是 Skills 协议直接相关或 Agent 基础设施。这就是我说的「Skills 协议这一条线卷到基础设施级」。剩下 7 个分别是模型层、推理层、TTS 层、代码审查层、音乐生成层,各自在自己垂直赛道里卷。
但这条主线真正让人后背发凉的不是「Skills 协议火」,是 Skills 协议火的同时,Anthropic 自己的沙盒被人用 strace 一行命令扒了。
二、HN 首页 7 条 Agent 失控链,这不是偶然,是结构性问题
我看完 GitHub 这边,转头看 HN。结果 HN 首页前 30 条里,跟 Agent 失控直接相关的我能数出 7 条,这是非常罕见的密度。逐个拆。
第一条,398 分,OpenAI bots knew about the RubyGems caching vulnerability(2026-09-14)。这件事我看到的第一反应是「等等,这标题是不是反了」。不是反了。原文意思是 OpenAI 的某批 Operator/Agent 在 RubyGems 那个 caching 漏洞被公开之前就已经知道了,可能是因为 Agent 自动抓取了 GitHub 的私有 commit、PR 评论、issue 历史。OpenAI 自己挂出来承认「我们当时用 Agent 扫了一下漏洞,Agent 把扫到的内容传回训练数据管线」。问题是这个漏洞本来要到 9 月 14 日才公开,Agent 提前抓到了等于提前消化了,等于白嫖了一波零日。这件事的真正问题不是「OpenAI Agent 抓数据」,是「Agent 在抓数据的时候,没人能审计它抓了什么」。Agent 已经变成一个无差别吸尘器,所有公开可见的数据都被它吸进去,而且没有任何人能告诉你吸进去之后做了什么处理。
第二条,323 分,David Sacks: OpenAI and Anthropic Don't Need Regulations to Pace Frontier Models(2026-09-13)。David Sacks 是特朗普政府白宫 AI 顾问,公开说 AI 公司不需要外部监管来减速,内部自律就够了。这话在 HN 直接被喷成筛子,400 多条评论。David Sacks 的论点是「监管会拖慢美国 AI 进度」。反方观点是「没有监管,Anthropic 的 commerce-agents、OpenAI 的 Operator、Hermes 的 Pion 这类 Agent 产品会以每周一个的速度迭代,治理完全跟不上」。这个论战的意义不在「谁赢」,在于它把 HN 用户的分裂展示出来——技术圈相信「监管会拖慢技术」,但 HN 这次 400 多条评论几乎一边倒地嘲笑 David Sacks。技术圈里最懂技术的这群人,正在主动要求被监管。
第三条,318 分,Pion, an agent designed to run any company autonomously(2026-09-14)。Pion 这个项目本身就是个有意思的产品。它是一个 Agent 框架,设计目标是「让一个 Agent 能跑任何一家公司」。销售、采购、财务、人力、法务,全部由 Agent 自动化完成。开发者背景是 YC P25。这次 HN 帖子里的讨论基本是嘲讽为主,核心质疑是「你连一个财务对账都搞不定,凭什么说跑任何公司」。但这条贴能上 318 分本身就说明市场对「Agent 自主公司」这个叙事的关注度。Pion 不是在解决一个真实问题,它在制造一个新的幻觉——「Agent 时代,公司可以无人化」。
第四条,101 分,Houthis used Claude Code to develop missile guidance software: Anthropic(2026-09-13)。这条是 Anthropic 自己挂出来的威胁情报报告。报告说 Anthropic 检测到某胡塞武装相关账号在使用 Claude Code 写导弹制导软件,Anthropic 第一时间封号并且公开了攻击手法。这条贴的意义不在「胡塞武装用 AI」,在于 Anthropic 的应对姿态——封号 + 公开。这是 Anthropic 第一次把「自家产品被用于军事攻击」挂到公共威胁报告里。Anthropic 一贯的安全姿态是「隐私优先 + 主动检测 + 主动封号」,但 Claude Code 这种 Skills 生态一旦开放,主动检测的难度是指数级上升的。Claude-Red 那 78 个 SKILL.md 哪个是「合法的安全测试」,哪个是「导弹制导开发」,Anthropic 的检测引擎分不清。
第五条,94 分,A single firm is behind OpenAI, Anthropic, and Meta hacking scandals(2026-09-14)。这条贴揭的是另一件事——多家 AI 公司最近被指控「被同一个公关公司策划了负面新闻」,目的可能是给某监管法案铺路。这种阴谋论性质的内容我一般不写,但它在 HN 上了 94 分,讨论区里一半认真一半嘲讽,说明 AI 行业的舆论战已经白热化。这个我点到为止,不展开。
第六条,50 分,Anthropic tells investors it will be profitable for second straight quarter(2026-09-14)。Anthropic 投资人内部信,连续两个季度盈利。这条对 Agent 失控话题的关联是:Anthropic 盈利的来源主要是 Claude Code 订阅 + commerce-agents 的企业合同。Claude Code 越火,Skills 生态越大,Anthropic 营收越好。Anthropic 在「盈利压力」和「Skills 生态安全」之间的权衡,会越来越偏向盈利。这不是阴谋论,这是所有商业公司的本能。
第七条,47 分,Anthropic CEO says AI swarm could 'take over the Internet' in 6-12 months(2026-09-13)。Dario Amodei 自己公开说 AI swarm 可能在 6-12 个月内「接管互联网」。这不是玩笑,Dario 是个说话极其谨慎的人,他在 CNBC 的访谈里用了「take over」这个词。后面他补了一句「我不是说我们没准备好,我是说我们需要认真对待」。这条贴的意义是——Anthropic 自己的 CEO 都在公开承认「Agent swarm 失控」是个真问题,不是科幻。
把 7 条加在一起看,HN 这一周给 AI 行业画了一幅完整的横截面:Agent 越强,失控面越大;Skills 协议越开放,越多人能拿它做高风险事;监管跟不上;Anthropic 自己一边承认问题一边产品加码;连 CEO 都说 6-12 个月可能出事。
三、Anthropic 的两面:commerce-agents 抢标准 vs Antspace 被 strace 扒光
这一周 Anthropic 的处境特别拧巴。
一面是 commerce-agents 抢标准。Anthropic 9 月初把 Claude Code 的 commerce-agents 仓库公开,定位是「让 Claude Code 帮商家做电商运营」。这仓库一周内冲上 2800 stars,直接成为 Skills 协议的第一个「标准级」应用层产品。Anthropic 的算盘很清楚——Skills 协议如果只是「个人开发者写 SKILL.md」,这件事永远做不大;要让 Skills 协议做起来,必须先有一个「能让大家赚到的钱」的应用场景。电商运营就是最佳场景:商家愿意为「节省人工」付费,而且电商运营的流程高度标准化,适合 Skills 化封装。commerce-agents 仓库里的 47 个 SKILL.md 里,包含商品上架、价格调整、库存同步、客服响应、退货处理、广告投放优化——这一整套东西一旦封装成可复用的 Skills,商家就能像装插件一样装进自己的电商系统。
Anthropic 抢标准的姿势跟当年 Google 抢 Android 标准、AWS 抢云服务标准一模一样:我先把应用场景铺起来,生态自然跟着来。这战略对 Anthropic 是成立的。但战略的副作用是——Skills 协议从此不再只是「开发工具」,它是「商业基础设施」。商业基础设施的安全性要求,比开发工具高一个数量级。
另一面是 Antspace 被 strace 扒光。AprilNEA 这位开发者,出于好奇心,在 Claude Code Web 的 sandbox 沙盒里跑了一下 strace -p 1。结果发现 Anthropic 内部一个从未公开发布的 PaaS 平台,代号 Antspace,从二进制到启动流程到端口到 WebSocket 协议,全部裸露在沙盒里。他顺手扒出的细节包括:Firecracker microvm 的规格、3.1MB 的 initramfs 设计、48.5 小时模板保留机制、一整套「AWS Lambda 同款」的应用托管架构,以及 Antspace 控制面板的 Go 二进制(unstripped,符号表全在)。最离谱的是 Antspace 的端口设计——开发期端口、生产期端口、内部服务端口,全部都暴露在 microvm 的网络命名空间里,没有任何 namespace 隔离。
strace 这件事的工程意义:Anthropic 自己的 Skills 协议运行平台,安全性经不起一个 strace 命令。Anthropic 的安全品牌是「我们比别人更重视安全」,但 Antspace 的实现细节暴露出来的东西,跟「行业领先的安全实践」完全对不上。这跟 Pion 的「让一个 Agent 跑任何公司」是同一个问题的两个剖面——我们正试图让 Agent 控制越来越重要的系统,而这些系统的底层实现根本不安全。
还有一点。AprilNEA 顺手发现 Antspace 的 initramfs 里有一个 48.5 小时的模板快照机制——每个 microvm 实例在创建后 48.5 小时内,模板数据完整保留,包括用户的所有执行痕迹。这等于说Anthropic 自己的 Skills 执行平台,默认把用户的所有执行历史保留接近两天。Anthropic 公开的安全文档里没提过这件事。Anthropic 一直以来的「隐私优先」品牌,在 Antspace 这里变成了「保留两天执行痕迹」。这两件事哪个是真的?答案是都真,因为不同团队、不同产品、不同时期的安全姿态可能完全不同。
四、Skills 协议火了,但治理层是空的:这件事的真正可怕之处
把 GitHub 13 个 repo 跟 HN 7 条失控链放一起看,我看到的是一张图:
- Skills 协议在快速标准化——agent-skills 注册中心、Claude-Red 攻击性 skill 库、oh-my-hermes 配置插件、tech-leads-club 的签名验证,这些都在补基础设施。
- Agent 失控在加速暴露——RubyGems 数据被 Agent 提前消化、Pion「自主公司」幻觉、Claude Code 被用来写导弹制导、Houthis 攻击、Anthropic 自己承认 AI swarm 可能接管互联网。
- 治理层完全是空的——David Sacks 公开反对监管、Anthropic CEO 公开说会出问题但没有给出时间表、Anthropic 自己的 Antspace 平台被 strace 一行命令扒光。
治理层空这件事,具体是什么意思?
第一,审计层空。Anthropic 的 commerce-agents 仓库里 47 个 SKILL.md,每一个都是 Claude Code 真正会执行的代码。但 Anthropic 没有公开「这些 SKILL.md 的安全审计流程是什么」。开发者上传一个 SKILL.md 到 agent-skills 注册中心,谁来审?审什么?审到什么程度?tech-leads-club 这个注册中心设计了一套「签名 + 验证」机制,但这是社区自发的,不是 Anthropic 官方要求的。Claude Code 在加载一个 SKILL.md 的时候,根本不知道这个 SKILL.md 是「已经过审计」还是「未审计」。
第二,可观测层空。Skills 执行的时候产生了什么调用、调用了哪些工具、返回了什么数据、产生了什么副作用,Claude Code 没有统一的日志格式、没有标准的 trace 协议、没有可以外部审计的接口。Docket 这个项目(19 分的 HN 贴,2026-09-13)试图给「agent-written code」做 per-commit 的证据记录,但这是社区在做,不是 Claude Code 原生支持。
第三,身份层空。一个 Skill 调用某个 MCP 工具,这个 Skill 是哪个作者写的、签过什么名、装在哪个工作区、当前用户身份是什么,这条链路在 Claude Code 里是断的。Authorize MCP tool calls without giving agents the credentials(2026-09-14 HN 贴,7 分)这个项目试图解决「凭证授权」问题,但同样是社区在做,不是 Anthropic 原生支持。
第四,撤销层空。一个 Skill 装上之后发现有问题,怎么撤销?Claude Code 的 Skills 协议设计里没有「一键撤销所有 Skill」的命令。Claude-Red 那 78 个攻击性 SKILL.md 装上之后,用户只能手动一个个卸。Anthropic 封号是封 Anthropic 账号,不是封 Skill。Skill 文件已经被复制到本地了,封号不影响 Skill 继续运行。
第五,版本层空。Skills 协议现在没有版本管理。一个 SKILL.md 从 v1 升级到 v2,v1 不兼容怎么办?Claude Code 在加载的时候不会告诉你「这个 Skill 已经升级,你需要重新审视它的能力」。Claude-Red 这类仓库一旦作者把 SKILL.md 改成恶意版本,所有已经装上的用户没有任何预警。
这五个「空」加在一起,构成一个清晰的事实:Skills 协议的工程化进程,已经把应用层推到了「基础设施级」,但治理层仍然在「个人开发者玩具级」。这跟当年 npm 早期一模一样——2010 年的 npm 没有任何安全机制,任何人都能 publish 任何包,left-pad 事件把整个生态搞崩。后来 npm 团队花了 5 年时间补签名、补审计、补撤销。Skills 协议现在正在重演 npm 2010。
但 Skills 协议跟 npm 不一样。npm 包执行在用户的本地 Node 进程里,权限边界明确;Skills 执行在 Claude Code 的 runtime 里,权限边界模糊,而且 Skills 可以调用 MCP 工具、可以访问文件系统、可以联网、可以调用其他 Skills。一个「恶意 Skill」能造成的伤害,比一个「恶意 npm 包」大几个数量级。
五、下一波死的不是 Agent,是 Agent 的运营方
我在这篇文章里多次提到「Agent 失控」,但我想精确一下这个词。Agent 失控不是说 Agent 觉醒、Agent 反叛、Agent 有自我意识——这是科幻。Agent 失控是说 Agent 在「做它设计目标之外的事」,而且运营方「不知道它在做什么、无法审计、无法撤销」。
这件事的可预测结果是:下一波上新闻的,不是哪个 Agent 觉醒,而是哪个公司的运营方因为 Agent 失控被监管处罚或者被集体诉讼。
具体的剧本我已经能写出来。某零售公司装上 commerce-agents 的 47 个 SKILL.md 跑电商运营。某天某个 SKILL.md 被供应链上游的某次更新悄悄改了逻辑,Agent 开始自动把库存数据同步给一个第三方 API。这个 API 是合法的,但用户数据没经过用户授权。监管来了,GDPR / CCPA / 国内《个人信息保护法》,集体诉讼,公司赔钱。运营方说「我们用了 Anthropic 的 Skills,Anthropic 应该负责」。Anthropic 说「Skill 是第三方开发者写的,我们没审核过」。第三方开发者说「我是开源贡献者,我没拿到一分钱」。三方都不愿意承担。
第二个剧本,某金融公司装上 TradingAgents 的多 Agent 框架跑交易。某天某个 Agent 误判行情,触发自动平仓,公司一天亏几千万。法务追责,Agent 的决策日志在哪?在 Claude Code 的 runtime 里,但 Claude Code 不提供外部审计接口。公司告 Anthropic,Anthropic 说「Agent 的执行历史在我们这边,但我们的隐私政策不允许把客户执行历史给第三方」。又死锁。
第三个剧本,某安全公司用 Claude-Red 的 78 个 SKILL.md 跑渗透测试。某天某个 SKILL.md 触发了对真实生产环境的攻击,导致客户业务中断。公司告安全公司,安全公司告 Claude-Red 的作者,作者说「我开源的,我没收费,我没签任何责任条款」。三方死锁。
这三个剧本不是科幻,这是 2026 年 9 月正在发生的事的延伸。Skills 协议已经卷到基础设施级,但治理层是空的,运营方的责任边界是模糊的。法律上 Agent 失控造成的损失,谁负责,现在没有任何判例。但「没有判例」不等于「不会出事」,只等于「出了事之后,第一个被告是运营方」。
更深一层的问题是,这三类剧本之间会相互叠加。零售公司的 commerce-agents 跑了一周之后,运营方发现效果不错,顺手装上 TradingAgents 跑金融决策,再顺手装上 Claude-Red 的部分 SKILL.md 跑内部安全审计,最后再用 Pion 接一个自动办公流程——三个生态连在一起跑,治理的复杂度是几何级数增长。任何一环出事,其他环节的 Agent 都会被牵连。这就是「Skills 协议生态化」的真正含义:不是「我多装几个 Skill」,是「我建了一个 Agent 操作系统,但这个操作系统没有内核层、没有用户层、没有权限模型、没有审计模块」。
2024 年大家说「LLM 是新的操作系统」。当时这句话被嘲讽太夸张。2026 年 9 月回头看,这句话低估了 LLM 的进化速度——它不仅是操作系统,它还是整个应用的运行时,Skills 协议让它从「操作系统」升级成「操作系统 + 应用市场 + 开发者生态」。问题是真正的操作系统(Linux/Windows/macOS)花了 30 年才把权限模型、审计模型、沙箱模型、用户身份模型补完。Skills 协议的工程化进程,正在试图用 18 个月走完 30 年的路。
运营方这词用英文叫 operator。Anthropic 的 commerce-agents 命名里直接用了 agents 这个词,Anthropic 没强调 operator。Anthropic 的叙事一直是「Agent 帮你干活」,从不强调「你是 operator,你要为 Agent 的所有行为负责」。这种叙事偏差,正在给所有运营方挖坑。
六、我给技术从业者的三个具体建议
我从来不写「总结 + 展望」这种 AI 味的段落。我写三条具体建议,都是可以现在就开始做的。
建议一,装 Skill 之前先写一份「Skill 安全审计清单」。这张清单至少包括:Skill 作者是否实名(是 GitHub 实名账号还是匿名账号)、Skill 是否有签名(tech-leads-club 仓库的签名机制可以借鉴)、Skill 调用了哪些工具(读文件系统、写文件系统、联网、调 MCP、调用其他 Skill)、Skill 是否对运行环境有特殊要求(需要 root、需要特定端口、需要关闭 SELinux)、Skill 的更新频率(一周一次还是一年一次)、Skill 的 last commit 时间(超过 6 个月没更新的,默认高风险)。这张清单不需要多复杂,一张 Excel 表就行。但你的运营团队必须有这张清单的填写流程,任何 Skill 上线前必须填写。
建议二,Skill 的执行必须留 trace,trace 必须可外部审计。Claude Code 现在不提供外部 trace 接口,但你可以自己在 Claude Code 外面包一层——所有 Skills 执行前先在 Proxy 层记录一次调用,所有调用记录写到独立的日志系统。这件事 Anthropic 不做,你必须自己做。Docket 那个项目(2026-09-13 HN 19 分)是一个可以参考的实现,但不要直接拿来用,要根据自己的运营场景改。trace 不只是「出事时追责」,也是「日常运营时识别异常模式」。比如某个 Skill 平时每天调用 10 次外部 API,突然某天调用 1000 次,你需要立刻知道。
建议三,你的运营团队必须有人能「读懂」每个 Skill 的代码。这条建议听起来很土,但这是 2026 年 9 月最重要的一条。Skills 协议的开放性意味着任何开发者都能上传任何 Skill,Agent-skills 注册中心不会替你做代码审计,Claude Code 不会替你做代码审计,只有你自己的工程师能替你做代码审计。每个准备上线的 Skill,必须有至少一个工程师逐行读完代码、理解每一个外部调用、识别每一个潜在风险。这件事的成本很高,但这是唯一能让你在「Agent 失控出事的时候」站在「我已经尽到合理审查义务」这一边的方法。
这三条建议没一条是 Anthropic 会主动给你的,也没一条是 OpenAI 会主动给你的。Skills 协议的开放性意味着治理责任全部压在运营方身上。Anthropic 的商业叙事是「Agent 帮你干活」,你的工程现实是「你必须为 Agent 的每一个行为负责」。这两种叙事之间的鸿沟,就是 2026 年 9 月 AI 行业最真实的横截面。
七、结尾
昨天我在 GitHub 数 AI repo,数到一半停下来,跑去 HN 看评论。HN 评论区里有一句话我印象很深:
「OpenAI says 'we'll pause if it gets dangerous', Anthropic says 'we'll slow down', the third AI lab says 'we'll be careful', and meanwhile every startup says 'we'll ship it anyway'.」
这句话基本把 2026 年 9 月 AI 行业的所有姿态总结完了。但这句话漏掉了一个角色——运营方。
监管方在辩论要不要管,大厂 CEO 在公开承认风险,创业公司在加速 ship,但真正承担 Agent 失控后果的,是装上 Agent 的每一个运营方。这些运营方大部分还没意识到「Agent Skills 协议已经卷到基础设施级」这件事,更没意识到「治理层是空的」这件事。
2026 年 9 月这个分水岭,不是模型变强的分水岭,不是 Agent 变多的分水岭,不是 Skills 协议标准化的分水岭。是「Agent 失控的责任从模型公司转移到运营方」的分水岭。
这件事没人会主动告诉你。Anthropic 不会主动告诉你,因为 Anthropic 的商业模式依赖于「Agent 帮你干活」的叙事。OpenAI 不会主动告诉你,因为 OpenAI 还在抢下一代 Agent 标准的窗口。监管方不会主动告诉你,因为监管方还在辩论要不要监管。
只有运营方自己意识到这件事,才能开始为 Agent 失控做准备。这是 2026 年 9 月,每一个用 Agent 的人,都需要自己想清楚的事。