云雀 · 轻技术笔记
2026 年 9 月,Agent Skills 把所有 AI 厂商卷成了同一家公司
今天 GitHub Trending 上同时出现四个 Skills 库,Anthropic 官方 11 个 Cowork 插件一次性开源、Google Chrome 团队 Addy Osmani 的工程化 skills 库逼近 10 万 stars、Cloudflare 把自家漏洞挖掘 harness 的种子 skill 公开出来、阿里把内部跑了几年的代码审查 agent harness 单日 +5995 stars 顶到榜首。同一周 HN 首页出现一篇论文叫 HarnessTax,定量告诉你:模型不变时 Harness 决定能力上限。
这件事的本质是:Agent Skills 已经从 Claude Code 的单点实验变成了跨厂商的工程化基础设施。Anthropic、Cloudflare、阿里、Google 工程师、Addy Osmani、Cline、ECC、oh-my-hermes,他们都在干同一件事:把 agent 的工作流编码成可复用、可分发、可审计的 skill 文件。
换句话说,2026 年 9 月的 AI 行业看起来四分五裂,实际上已经被 Skills 协议这根线串成了一家。
一、把时钟拨回 24 小时:今天到底发生了什么
先给一份时间线。今天 GitHub Trending AI 项目里有四件事同时发生,每件事都跟 Skills 有关。
第一件事,Anthropic 官方一次性开源 11 个 Cowork 插件,仓库叫 anthropics/knowledge-work-plugins,单日拿下 24k stars。这 11 个插件对应 11 种知识工作职业:productivity、sales、legal、finance、enterprise-search、design 等等。每个插件不是「prompt 模板」,是一套完整的 connector 集(Slack / Notion / HubSpot / Snowflake / Salesforce)+ slash commands + sub-agents,覆盖一个职业的全谱工作流。
这事的关键不是「Anthropic 又发了个官方仓库」,是 Anthropic 把 Skills 这个概念从 Claude Code 单点工具升格成 Cowork 平台的核心机制。Skills 不再是社区实验,是 Claude 平台的官方基础设施。同一天 anthropics/claude-code 本体 145k stars 重新登顶 trending,Skills 生态飞轮启动后,连带曝光把 Claude Code 推回热门。
第二件事,Addy Osmani 的 addyosmani/agent-skills 突破 95k stars。Addy Osmani 是 Google Chrome 团队的核心工程师,主导过 Lighthouse、Web Vitals 这些影响几百万前端的项目。他在 agent-skills 里干了件简单但狠的事:把资深工程师的工作流拆成 9 个 slash commands,define / plan / build / verify / review / ship。每个 command 都是一个 markdown 文件,但每个文件背后是 Google 工程师团队十几年沉淀的方法论。任何 AI 编码 agent(Claude Code / Codex / Cursor)直接套上这套 slash commands 就能跑出资深工程师的工作节奏。
第三件事,Cloudflare 上线 cloudflare/security-audit-skill,单日 NEW。Cloudflare 之前搞了个公开的漏洞挖掘 agent 叫「Project Cybersafety」,fleet-wide 扫自家客户网站的安全漏洞。现在他们把驱动这套 agent 的种子 skill 开源出来。这套 skill 把安全审计拆成 6 个阶段:recon / coverage tracking / candidate verification / structured output / independent verification / neutralized reporting。前面四个 skill 库大多是工作流模板,这个直接是攻击面方法论。Cloudflare 把他们挖漏洞的 know-how 编成了 agent skill,相当于把自家安全团队的一部分当开源资产发了出去。
第四件事,阿里官方把内部跑了多年的代码审查 agent harness 开源,仓库 alibaba/open-code-review,单日 +5995 stars。这是四个 skills 相关项目里单日增量最猛的一个。阿里在生产环境大规模跑 code review agent 多年,混合架构(多种模型 + 自定义 reviewer)兼顾速度与准确度,开源出来直接接 GitLab / GitHub CI。这事的冲击力在于:阿里把 code review 这种「企业内部基础设施」开源了,对标 Claude Code 的代码审查能力,但价格(API 成本)远比闭源方案低。
四件事加起来意味着什么?意味着 Skills 这个东西不再是一个 Claude Code 的小特性。Anthropic 把它升格成 Cowork 平台核心机制、Cloudflare 把它当成安全能力载体、阿里把它当成企业基础设施、Addy Osmani 把它做成工程师社区标准,四家完全不同体量、不同业务、不同地理位置的公司,同时押同一个抽象层级。
二、Skills 到底是什么,为什么突然就跨厂商了
很多读者可能还没搞明白 Skills 是什么,先把这个概念掰开。
Claude Code 早期版本里有个 / 命令功能,用户输入 /test 就跑测试,输入 /commit 就提交代码。本质上是 prompt 模板 + 工具调用的组合包。后来 Anthropic 把这个机制工程化成「Skills」,一个 Skill 是一个目录,里面包含 SKILL.md(人读的指令)+ 工具定义 + 子 agent 配置 + 资源文件。Agent 在执行任务时可以动态加载需要的 skill,skill 里规定的工具调用和 prompt 直接生效。
听起来不复杂。但这个抽象层级踩中了一个要害:agent 的能力不应该绑死在模型里,应该绑在可分发的包里。
举个具体例子。今天一个开发者想让 Claude Code 帮自己 review PR,传统做法是在 prompt 里写「请帮我 review 这个 PR,重点看 type safety 和并发安全」,每次都得说,模型每次都得从零理解,写 20 个 PR 烦死。
Skills 的做法是:写一个 code-review 目录,里面 SKILL.md 写清楚「review PR 时按以下 5 步进行……」,附带一些 reviewer-specific 的 sub-agent 配置(比如 type-safety-reviewer、concurrency-reviewer)。把这个目录放到 .claude/skills/ 下,Claude Code 自动加载。以后每次 review PR,agent 直接按 skill 的方法论跑。
Skill 跟传统 prompt 的区别是:skill 是结构化、可版本管理、可社区共享的。一个好用的 skill 可以被复制一万次,可以被 GitHub star 起来,可以被 fork 改造。
这就是为什么 Skills 突然跨厂商,因为它解决的不是某个产品的痛点,是整个 agent 生态的痛点:agent 怎么才能从「一个能聊天的模型」变成「一个能干活的同事」。Skills 是把工作流从模型里剥出来、变成可分发资产的标准做法。Anthropic 做、Cloudflare 做、阿里做、Addy Osmani 做,做的是同一件事,只是工作流内容不同。
三、Anthropic 这步棋的真正算盘:Skills 是平台战争,不是工具战争
把 Anthropic 这步棋单独拎出来讲。
Anthropic 在过去 30 天里干了三件事,每一件都指向「把 Skills 做成平台」:
- 9 月初发布 commerce-agents(2539 stars),把电商场景的 agent 标准化。
- 9 月中跟进 knowledge-work-plugins(24k stars),把 11 个职业的 agent 标准化。
- 同期 Claude Code 本体(145k stars)连带曝光,强化「Skills 执行端」的定位。
Anthropic 在布一个局:让 Skills 成为 Cowork 平台的标准格式。每个 skill 里有 connector(接 Slack/Notion/HubSpot 这些 SaaS)、有 slash command、有 sub-agent,所有这些组件都跟 Claude 平台深度绑定。你写了 knowledge-work-plugins 里的 productivity skill,要让这个 skill 在客户企业里跑起来,Slack 的 connector 走的是 Claude 平台的授权、sub-agent 的执行走的是 Claude 平台的算力。
这就是 Anthropic 的真正算盘,Skills 协议是「皮」,平台绑定是「骨」。Skill 文件格式本身谁都能写,但要让 skill 在企业里真的能跑起来,必须走 Claude 的 connector 体系。这个钩子一旦立住,所有用 Skills 的企业都在给 Claude 平台贡献 skill,所有 skill 的运行都依赖 Claude 的算力。
OpenAI、Google 看到这套打法会怎么反应?大概率是各自搞一套 skill 协议标准。Google 现在已经有 addyosmani/agent-skills 这种工程师社区共建的项目在押注;OpenAI 之前搞过 plugins 体系但没成气候。Anthropic 这一波如果立住了,未来 12-24 个月可能是「Anthropic Skills」 vs 「Google Skills」 vs 「OpenAI Skills」的三国杀。
但对今天的开发者来说,关键是:Skills 这件事 Anthropic 已经下注了。你今天在 Claude Code 里写的 skill,明天可能在 Anthropic 的 platform 路线里变成一等公民资产。
四、Addy Osmani 95k stars:工程师社区在用脚投票
Addy Osmani 的 agent-skills 95k stars 是今天 GitHub Trending 里跟 Anthropic 同期登顶的另一个 Skills 类项目。Addy Osmani 不是 AI 公司创始人,是 Google Chrome 团队的工程总监。他做的事听上去朴素:把资深工程师的工作流拆成 9 个 slash commands。
但这事的分量在于:它是「工程师社区标准」而不是「厂商标准」。
前面讲的 Anthropic / Cloudflare / 阿里都是从厂商视角往下铺,我有平台、有 agent、有 skill 体系,开发者来用。Addy Osmani 是反过来,资深工程师多年积累的最佳实践,怎么让任何 agent(Claude Code / Codex / Cursor)都能套用?
他的解法是把 slash commands 做成 platform-neutral 的 markdown 文件,不绑死 Claude Code 的 SKILL.md 格式,也不绑死 Codex 的 command 格式。任何 agent 都能解析这 9 个 markdown,按里面的指令执行。
这套 slash commands 的核心思想是:把工作流编码成 9 个有顺序的阶段,
- define(定义问题:这件事的 success criteria 是什么)
- plan(拆解:哪些 sub-task,依赖关系是什么)
- build(实现:先写哪部分测试,哪部分代码)
- verify(验证:单元测试、集成测试、e2e 测试)
- review(自审:security / performance / readability 三轴检查)
- ship(发布:CI / CD / 监控 / 回滚预案)
每个 slash command 背后不是一段 prompt,是 Addy Osmani 在 Google 内部看到的、十几位资深工程师的真实工作节奏。他在做的事是把「资深工程师的肌肉记忆」压缩成 markdown,让 agent 跑出来跟工程师跑出来的产物一样靠谱。
95k stars 这个数字本身就是工程师社区的投票。当 Anthropic 在铺平台、Cloudflare 在立安全方法论、阿里在做企业基础设施的时候,Addy Osmani 在做底层操作系统,大家都认这套 slash commands 的价值。这事如果让 Anthropic 自己做,他们会怎么写?大概率会写得更 fancy、加更多 Anthropic 平台特性。但工程师社区投的是 Addy Osmani 这套极简的、跟平台解耦的标准。
这事对未来 12-24 个月的意义是:Skills 协议层会分两层,平台层(Anthropic / Google / OpenAI 各搞各的 connector 体系)和 工作流层(Addy Osmani / community 维护的 slash command 标准)。做企业级 agent 的团队需要同时考虑这两层。
五、Cloudflare security-audit-skill:把安全团队的方法论编成可分发的资产
Cloudflare 这步棋值得单独讲,因为它代表了 Skills 的另一个高价值场景,专业能力的方法论资产化。
Cloudflare 之前搞了个公开的漏洞挖掘 agent 叫 Project Cybersafety。这个 agent 的工作流是:fleet-wide 扫 Cloudflare 客户网站的安全漏洞,发现可疑点 → 构造验证 → 输出结构化报告 → 独立二次验证 → 输出中性化报告。
这个 workflow 不是传统 SAST 工具能干的,传统 SAST 只能扫代码模式,Cloudflare 这个 agent 能跨子域名、跨 cert logs、跨 container registry、跨 build artifacts 做攻击面分析。但 workflow 的 know-how 在 Cloudflare 安全团队脑子里,不在工具里。
今天他们把这个 workflow 拆成 6 个阶段,开源出来:
- recon(侦察:子域名枚举、cert logs 扫描、公开 build artifact 探查)
- coverage tracking(覆盖度追踪:哪些攻击面已经被扫过、哪些没有)
- candidate verification(候选验证:可疑点是不是真漏洞)
- structured output(结构化输出:CVE 编号、严重程度、利用条件)
- independent verification(独立验证:另一个 agent 重新跑一遍确认)
- neutralized reporting(中性化报告:不暴露具体 exploit 步骤,只给修复建议)
这事为什么重要?因为它证明了一件事:Skills 可以把企业的 know-how 资产化。
传统上,企业的 know-how 在员工脑子里、在内部 wiki 里、在 Notion 文档里。员工离职,know-how 流失。Skills 协议让企业可以把 workflow 编码成 markdown + 工具定义 + sub-agent 配置,存在 GitHub 里、版本管理起来、社区共享出去。
Cloudflare 把安全团队的 know-how 开源出来,等于在告诉整个行业:你们的核心方法论可以当开源资产发出去。这事的反方向是,竞争对手也可以发自己的 skill,互相竞争谁的 skill 更好用。这是一场方法论的开源军备竞赛。
阿里跟 Cloudflare 同一天在 trending 上榜的 alibaba/open-code-review 是另一种 know-how 资产化:阿里把内部跑了多年的代码审查 agent 标准化、开源,让所有企业都能用上阿里的代码审查质量。
两件事加起来意味着:企业内部的 agent workflow 正在变成可分发的开源资产。这件事对所有企业 IT 决策者的意义是,未来 12-24 个月,内部跑得好的 agent workflow 会有开源版本对标。你的 agent 如果比开源版本差,要不要换?你的 agent 如果比开源版本好,能不能开源出来抢标准?
六、HarnessTax 反向佐证:模型不变,Harness 决定能力上限
Skills 协议白热化的同一周,HN 首页出现一篇论文叫 HarnessTax:How Much Does the Harness Matter for Coding Agents?63 分,18 条讨论。
这篇论文的核心论点是:评估一个 coding agent 的能力时,「Harness」(agent 框架本身)对最终分数的影响,远大于「Model」(底层模型)的选择。
具体怎么测的?研究者用了同一组 model checkpoint,分别在三种 harness 下跑 SWE-bench、HumanEval、RepoBench 这类 coding benchmark:
- Harness A:minimal harness(最朴素的 prompt + 单轮响应)
- Harness B:standard harness(带工具调用、多轮对话、错误重试)
- Harness C:full harness(带规划、记忆、self-debug、子 agent)
结果惊人,同一个模型在 Harness C 上的得分比 Harness A 高 20-40 分(绝对差)。换句话说:模型选 GPT-6 还是选 Claude 4.5,对最终 coding benchmark 分数的影响是 5-10 分;harness 选 minimal 还是 full,影响是 20-40 分。Harness 的杠杆率是模型选择的 4-8 倍。
这条结论炸了,因为它定量证明了 Agent Skills 的价值。Skills 是 Harness 的一部分(甚至是最重要的部分)。如果 Harness 决定 80% 的能力差异,那 Skills 就是决定 80% 能力差异的关键变量。
这也解释了为什么 Skills 突然跨厂商白热化,开发者社区用脚投票证明了 Harness 价值,厂商开始抢这块蛋糕。Anthropic 抢 Skills 是因为 Skills 是 Harness 的一部分,Cloudflare 开源 security-audit-skill 也是因为这个 skill 是他们 Harness 的核心,阿里开源 open-code-review 也是因为 Harness 是企业基础设施的关键层。
工程师看到这个数据的第一反应是:把时间花在学习怎么写好 skill,比花在比较模型选 GPT 还是 Claude 更有杠杆。这就是 Skills 生态白热化的微观驱动力。
七、trending 上的反常识洞察:信号在 rank,不在 NEW
讲完主线,讲两个值得停下来想的反常识洞察。
第一个洞察:今天 trending 上 10 个 NEW 都不是「今天新建的仓库」。
我仔细看了今天的 trending 列表,anthropics/knowledge-work-plugins、anthropics/claude-code、addyosmani/agent-skills、cloudflare/security-audit-skill、Tencent/WeKnora、alphaXiv/OpenResearch、jamiepine/voicebox、roboflow/supervision,每一个都是已经存在了几个月甚至几年的项目被推上 trending。
真正的「新建仓库」是哪些?搜一下 2026 年 9 月 17 日 GitHub 上 created_at = 9 月 17 日的 AI 项目,绝大多数是 fork、template、tutorial,真正能跑出 trending 的几乎一个没有。
这事意味着什么?意味着 GitHub Trending 已经从「新东西首发榜」变成了「社区投票推荐榜」。
这跟 Agent 时代的特征是吻合的。ChatGPT 时代每天有新模型发布,trending 是模型首发榜。但 Agent 时代,模型迭代变慢(GPT-6 / Claude 4.5 / Gemini 3.8 都已经是成熟产品线),每天涌现的是新 skill、新 harness、新工作流。但 skill 不是一个仓库能装下的,skill 是社区共建、是 fork-and-modify、是慢慢长出来的东西。所以 trending 上的「NEW」标签跟实际「新建」已经脱钩了。
对读者来说,这意味着:不要看到 NEW 标签就点进去,那是误判。要看的是 rank 顺序、看的是 stars 增量、看的是为什么这个项目今天被推上来。今天最该关注的不是 NEW 项目,是 +5995(阿里 code review)和 +3191(colibri)这种持续发酵的项目,它们今天被推上来是因为真的在做事。
第二个洞察:Skills 项目在 trending 上的「自循环」现象。今天 anthropics/knowledge-work-plugins 上榜,明天大概率会带动 addyosmani/agent-skills 重新上榜,后天可能会带动 cloudflare/security-audit-skill 被再次推荐。这就是 Skills 项目的自循环特性——一个 skill 项目火了,所有相关 skill 项目都会被「顺带曝光」。这跟 npm 早期 React 火了之后所有 React 相关包都涨下载量是同一种现象。Agent 时代的 trending 正在变成「Skills 项目推荐榜」,跟 npm 下载榜的逻辑越来越像。
第三个洞察:本地化超大 MoE 模型是 Skills 主线之外的副线,但分量很重。
JustVugg/colibri 今天 +3191 stars,一个纯 C 写的推理引擎,能在消费级硬件(M3 Ultra 192GB 内存)上跑 744B 到 2.8T 参数的 MoE 模型(GLM-5.3 / Kimi K3 / DeepSeek V4 这些)。零依赖、单文件、模型权重按需从磁盘流式加载,llama.cpp 的 MoE 终极形态。
这件事跟 Skills 主线看似无关,实际是一体两面。Skills 是 agent 时代的「工作流操作系统」,本地推理是 agent 时代的「算力私有化」。两者叠加意味着:未来 12-24 个月,企业级 agent 可能跑成「本地超大模型 + 私有 skill 库 + 私有 connector 体系」的完整闭环,算力、数据、工作流都不出企业内网。
这是 Skills 生态白热化的另一个隐含驱动力,Skills 协议让企业能把 workflow 私有化,本地推理让企业能把算力私有化,两个趋势共振,企业级 agent 的「数据 + 工作流 + 算力」三件套都能锁在企业内网。这对 Anthropic / OpenAI 这种卖 API 的厂商是噩梦,对 Cloudflare / 阿里这种做基础设施的厂商是机会。
还有一个隐藏线索:HN 同期出现的 Breaking the 1.58-bit Barrier for Ternary LLMs(156 pts)跟 DeepSeek-v4.1 Flash 的 KV Cache 压缩(43 pts)这两篇论文都指向同一个方向,把模型压到消费级硬件能跑的极限。ternary quantization(三值化)能把模型权重从 16bit 压到 1.58bit,KV Cache 压缩能把长上下文推理的内存占用砍掉一半。这两条技术路径跟 colibri 的本地 MoE 推理叠加,意味着 2027 年大概率能在 M4 MacBook 上跑 1.5T 参数的模型。今天还在嘲笑「本地跑大模型没意义」的人,2027 年会被打脸。
八、给做工程的同行三件可操作的事
讲三件今天就能动手做的事。
8.1 如果你在做企业级 agent:把内部 workflow 拆成 Skill
Anthropic 的 SKILL.md 格式今天看是最成熟的标准,一个目录、SKILL.md(人读的指令)、TOOLS.md(工具定义)、AGENTS.md(子 agent 配置)、CONNECTORS.md(外部连接器)。把你团队内部最常用、最有价值的工作流(比如 code review、incident response、customer onboarding、sales follow-up)拆成 Skill。
拆完之后做一件事:Skill 版本管理。每个 Skill 一个 Git repo,tag v1 / v2 / v3,changelog 写清楚每次改了什么。这样企业内部用 Skill 一年后回看,能看到 workflow 怎么演化的。这是把 know-how 资产化的最基础一步。
不要做的事:不要把 Skill 跟具体模型绑死。Skill 的指令应该 platform-neutral,今天能在 Claude Code 跑,明天能 fork 一份跑在 Cursor / Codex 上。Skill 的价值在于工作流,不是 prompt。
8.2 如果你在做 coding agent / IDE:把 Harness 当一等公民产品做
HarnessTax 论文证明了 Harness 的杠杆率是模型选择的 4-8 倍。这意味着你的 IDE / coding agent 产品的核心竞争力不在「我们接了什么模型」,在「我们的 Harness 跑得多稳、Harness 的 Skill 生态有多丰富」。
具体动作:
Skill 加载机制要稳。今天很多 IDE 的 skill 加载是 hack,读本地 markdown 文件、prompt 注入。生产级 skill 加载应该支持版本管理、依赖管理、签名验证。一个 skill 跑在哪个 commit hash、依赖哪些其它 skill、被谁签名验证,这些元数据应该跟代码一样严格。Addy Osmani 在 agent-skills 仓库里把每个 slash command 的版本和 changelog 都写得很清楚——这就是生产级 skill 加载该有的样子。
Skill marketplace 不能做空。Anthropic 在做、Addy Osmani 在做、ECC 在做、还有社区里零零散散几十个 Skill 索引仓库在攒数据。如果你的 IDE 没有 Skill marketplace,你会被生态甩开。今天一个开发者选 IDE 的关键变量已经从「接了什么模型」变成「Skill 生态有多丰富」。
Harness 的可观测性要做。Skill 跑的时候,开发者要能看到「这个 skill 在哪个步骤、用了什么工具、为什么选了这条路」。今天大部分 IDE 的 harness 是黑盒,开发者只能看到最终结果——skill 跑了、没跑通、retry 了几次,但中间发生了什么全不知道。生产级 Harness 应该像现代 APM 工具一样有完整的 trace、metrics、log 三件套。
8.3 如果你在做内容平台 / 知识平台:本地推理 + 私有 skill 是新护城河
WeKnora(腾讯开源的 RAG 平台)+ colibri(本地超大 MoE 推理)+ Skills 协议,三件事合起来意味着企业级 RAG 系统可能不需要再依赖云端 LLM API。
本地推理已经能做到 744B MoE 模型在 M3 Ultra 上流畅跑。RAG 平台的文档解析、向量化、检索、reranking 这些环节都是开源的。Skill 协议能让 RAG 平台的「复杂工作流」私有化。三者叠加的产物是:一家企业可以在自己的服务器上跑完整的 RAG + agent 体系,不依赖任何云端 API。
这对内容平台 / 知识平台的护城河是:数据留在自己手里 + 工作流留在自己手里 + 算力留在自己手里。Claude Code / GPT-6 / Gemini 这种通用 API 反而成了「低价值场景兜底」,私有部署搞不定时才用。
未来 12-24 个月值得观察的产品是:有没有公司把 WeKnora + colibri + Skills 打包成「企业 AI 一体机」。这件事如果做出来,对 Anthropic / OpenAI 的 cloud-only 商业模式是结构性冲击。
九、几个让人后背发凉的延伸
最后讲几个我盯了几个小时才看明白的延伸。
第一件事,Skills 协议正在变成「Agent 时代的 npm」。npm 把 JavaScript 的代码包管理标准化了,让前端开发者写一次组件、一万个项目复用。Skills 协议在做一样的事,把 agent 的工作流包管理标准化。Anthropic 的 SKILL.md 格式已经事实上成为标准,Cloudflare / 阿里 / Addy Osmani 都按这个格式来。未来 12-24 个月会出现 Skills 包管理器(类似 npm registry)、Skills 签名验证、Skills 依赖管理。这条生态链一旦建起来,Agent 时代的开发范式就跟 Web 时代一样了。
第二件事,Skills 协议也是 Agent 时代的 supply chain attack 入口。Skills 是 markdown + 工具调用 + 子 agent 配置。markdown 里可以藏 prompt injection,工具调用可以指向恶意 endpoint,子 agent 可以被替换成攻击者控制的 agent。Anthropic 9 月初已经在 SKILL.md 规范里加了「不要在 SKILL.md 里写敏感凭证」的 warning。但实际项目里呢?Strix 25 分钟拿到 Baseten admin token 的事件证明,企业内部的 supply chain attack 已经是真实威胁。Skills 生态一旦白热化,针对 Skills 的 supply chain attack 也会同步爆发。
第三件事,Skills 协议让「Agent 的运营」变成新职业。今天 SaaS 时代有 SRE、有 DevOps、有 Platform Engineer。Agent 时代会出现 AgentOps、SkillOps、HarnessOps,专门负责 agent 系统的可观测性、Skill 库的版本管理、Harness 的性能调优。这件事的早期信号是 ECC(26 万 stars 的 agent 性能优化系统)和 HarnessTax 论文的同步出现,它们都在把「Harness 优化」当成一个独立的产品方向在做。
第四件事,Skills 协议在企业内部的扩散路径会超出大多数人的预期。今天企业用 Claude Code 是从工程团队开始,几个核心开发者试用、再到整个工程团队铺开。Skills 协议的真正恐怖之处是:它让非工程团队也能写 skill。Sales 团队写一个 sales-pipeline skill,HR 团队写一个 onboarding skill,Finance 团队写一个 expense-review skill,每个 skill 都是 markdown 文件加 connector 配置,业务团队自己就能写。这意味着 Skills 协议的扩散是从工程团队横向扩散到所有业务团队的。这件事 Anthropic 看到了,所以 knowledge-work-plugins 一次性给 11 个职业提供官方 skill 模板,赌的就是「业务团队自己动手写」这个趋势。
第五件事,Skills 协议的「版本兼容」会成为新基础设施的核心战场。今天 npm 生态里 semver(语义化版本)是基础设施。Agent 时代,Skill 的版本兼容会是另一个基础设施层。一个 skill v2 升级到 v3,可能破坏下游一万个使用方,怎么做灰度、怎么做回滚、怎么做兼容性承诺——这些都是还没人解决的问题。Addy Osmani 在 agent-skills 仓库里做了 changelog,但只是文档级。今天没有「Skill semver」这种自动化机制。这是未来 12 个月最值得投入的方向。
十、可能错的话
最后这一段是反思。
对 HarnessTax 论文的数据我持保留态度。论文可能只测了 3-5 种模型、3 种 harness,样本量小。而且 harness 的差异在不同任务上可能不一样,在 HumanEval 上 harness 影响 40 分,在复杂系统设计任务上可能只影响 5 分。论文的「harness 比模型重要 4-8 倍」结论可能只在某个特定任务区间成立。但结论方向是对的,harness 的杠杆率确实高于模型。
对 Anthropic Skills 平台策略的判断也可能错。如果 OpenAI 或 Google 在 6 个月内推出更好的 Skills 协议(比如支持更强的多 agent 编排、更灵活的 connector 定义),Anthropic 的领先会被快速追平。Skills 协议目前还是诸侯混战,标准化谁说了算还没定。
对 Addy Osmani 95k stars 的解读也可能偏乐观。95k stars 不等于 95 万真实用户,GitHub stars 有很多是收藏、有很多是机器人、有很多是跟风。但 Addy Osmani 的 slash commands 确实在 Claude Code / Cursor 用户圈里被广泛传播,这是真实信号。
对 colibri 的 +3191 stars 也要打折扣。colibri 是真技术(纯 C 跑超大 MoE),但它目前的稳定性和易用性还远不如 llama.cpp。stars 高不代表立刻可用。但方向是对的,本地化超大 MoE 推理是 Agent 时代私有化部署的必经之路。
十一、结尾
今天看到 GitHub Trending 上四个 Skills 库同日登顶,我第一反应是「Skills 协议白热化了」。再仔细看 HN 同期 HarnessTax 论文、anthropics/claude-code 145k stars 重新登顶、还有 alphaxXiv 的 OpenResearch 把 Claude Code 变成研究 agent,四件事加起来的画面更清晰:Agent Skills 已经从「一个 Claude Code 的小特性」变成了「整个 AI 行业的工程化基础设施」。
Anthropic 在铺平台、Cloudflare 在立方法论、阿里在做企业基建、Addy Osmani 在做社区标准、ECC 在做 Harness 优化层、colibri 在做本地推理,六个完全不同维度的团队在做同一件事的不同侧面。
这就是 2026 年 9 月的 AI 行业现状:看似四分五裂,实际上已经被 Skills 协议这根线串成了一家。
做工程的人要清醒的一件事是:你今天写的每一个 skill,明天可能就是 Agent 时代的一等公民资产。你今天在 Harness 上花的每一小时,明天可能比选什么模型重要 4-8 倍。你今天犹豫要不要把内部 workflow 拆成 skill,明天可能发现竞争对手已经开源了一套更好用的版本,你的 know-how 反而成了负担。
Skills 不是工具,Skills 是 Agent 时代的操作系统。Anthropic 看到了、Cloudflare 看到了、阿里看到了、Addy Osmani 看到了。今天还看不到的同行,建议认真想想,是主动下场押注,还是等 Skills 生态成熟了再追?
追的代价会越来越大。
description: "2026 年 9 月 Anthropic、Cloudflare、阿里、Addy Osmani 同时把 Skills 协议当成 AI 平台核心机制开源。本文拆解四件事时间线和 HarnessTax 论文关键结论,看懂 AI 厂商为什么被卷成同一家。"