云雀 · 轻技术笔记

Anthropic 一周两次下场:Agent 商业化的「反工程真相」

AIAgentLLM大模型AIGC

过去一周,AI agent 圈最让我后背发凉的,不是哪家模型又跑分又破纪录,而是 Anthropic 这家最像「工程派」的模型厂商,连续两次亲自下场做 agent 框架

一次是上周末悄悄上线的 anthropics/commerce-agents——一个面向零售、电信、旅游、娱乐四个垂类的购物 + 商家双向 agent 蓝图,2.5k stars,4 天推送进 trending。

另一次,是 GitHub 上一周悄悄涨到 47k stars 的 heygen-com/hyperframes——一个用 HTML 写、用 ffmpeg 渲染的视频 agent 框架,HeyGen 的工程师挂在 anthropics 组织下做(不是 HeyGen 自家)。

再叠加 HN 上 Sep 7 那篇 738 分的 Claude Skills are awesome, maybe a bigger deal than MCP,加上 Sep 4-5 连续刷屏的 Claude Code 隐写术事件(2445 分、1376 分、2095 分——后面细讲)——这四件事挤在同一周里绝对不是巧合

下面这一篇我想掰开讲透一件事:Anthropic 为什么突然把"通用 LLM"路线悄悄换成"行业 agent 模板"路线?这个切换背后的工程真相,远比 OpenAI 押 Skills 协议、Cursor 押 IDE 入口要硬核,也更让国内做大模型的同行后背发凉。

一、被忽视的「Commerce Agents」到底在卖什么

我先把 commerce-agents 这个仓库的结构摊开讲——很多人看到 "shopping agent" 就以为是个客服 demo,这是误读。

这个仓库其实是三层架构

commerce-common/        # 共享基础设施:fencing, memory, skills, grounding, presentation
├── shopping-agent/      # C 端:购物、对比、加购、政策问答
├── merchant-agent/      # B 端:商家后台的运营、库存、活动、风控
└── plugins/commerce-builder/  # Claude Code 插件层

注意一个被大多数人忽略的细节——商家写操作全部 staged

every merchant write is staged until a person approves it

什么意思?商家 agent 想改一个 SKU 价格、改一个库存、改一个促销活动文案——它只生成 change proposal,必须经过后台运营人员人工批准才会落库。这跟传统 RPA 不一样,传统 RPA 是「执行 → 报告 → 必要时回滚」,这里是「提议 → 阻塞 → 等待 → 落库」。

第二个细节更狠——chat 不下单,checkout 必须宿主完成

Nothing places an order, charges a card, or changes a live listing: checkout renders the cart for the host to complete

购物 agent 算完购物车,把购物车渲染给宿主应用,真正的扣款由商家自己的支付系统完成。这等于把"钱"这件事从 agent 链路里物理剥离——agent 可以出错,但出不了"错扣钱"这种事故。

第三个细节——四个垂直共享同一套底座。零售、旅游、电信、娱乐,每个行业都跑在同一份 commerce-common 之上,差别只在后端 StorefrontBackendMerchantBackend 的接口实现。这个架构学的是 Stripe Connect 的思路——把行业差异收敛到接口层,把 agent 本身做成"接口无关"。

写到这里你可能已经明白我在说什么了——这不是一个 demo,这是一个 SKU。Anthropic 把"行业 agent 模板"做成 pip 包(shopping-agent-coreshopping-agent-runtimeshopping-agent-sdkmerchant-agent-coremerchant-agent-runtimemerchant-agent-sdk),加上 plugins/commerce-builder/ 这个 Claude Code 插件,意味着商家开发者只要装一个 plugin,跑一行 /scaffold-commerce-agent,Claude Code 就帮你把后端接口的脚手架搭好。

这意味着什么?意味着从今天起,"做一个电商 agent" 这件事不再需要 AI 工程师——只需要一个会写后端接口的传统业务开发者 + Claude Code + commerce-agents 的 plugin。

二、hyperframes 的真相:Anthropic 在押"视频 agent 的控制权"

讲完 commerce-agents,我们再来看 hyperframes。

heygen-com/hyperframes 的描述很简短:

Write HTML. Render video. Built for agents.

HTML 写视频,ffmpeg 渲染。47k stars,TypeScript,技术栈是 Puppeteer + GSAP + MCP。

但这个仓库挂在 heygen-com 组织下,跟 Anthropic 没关系啊——你可能会这么想。

让我告诉你我看到了什么。hyperframes 的核心创新是把视频创作抽象成 HTML/CSS 动画——你想做一个 30 秒的产品介绍视频,不再用 Premiere、AE、CapCut,而是写一个 HTML 页面,用 GSAP 写动画,然后跑 ffmpeg 把每一帧渲染成视频帧。

为什么这事重要?因为agent 最擅长写的就是 HTML,不擅长写视频时间轴。

传统视频工作流是「分镜 → 时间轴 → 关键帧 → 渲染」四步,每一步都是 GUI 操作,agent 几乎没法介入。hyperframes 把这个工作流压缩成「HTML + CSS + 一点点 JS」三步,每一步都是 agent 天然能写的代码。

这背后藏的是 Anthropic 在 Sep 5 那条 2445 分 HN 热帖 Claude Code is steganographically marking requests —— 大家当时只顾着讨论「Claude 在请求里藏水印是不是阴险」,没人注意到 hyperframes 的 README 第一段写着:这段 HTML 是给 agent 用的,agent 写完 HTML 直接渲染成视频,全程没有人类时间轴介入

把两件事放一起看,意思就出来了:

  1. Anthropic 已经把 agent 视为「能完整产出可消费媒介」的执行者
  2. Hyperframes 负责把"视频"这种最难自动化的媒介,强行塞进 agent 能写的格式(HTML)
  3. commerce-agents 负责把"购物"这种最深的业务流程,强行塞进 agent 能跑的框架(Skills + Backend 接口)

这不是两个独立项目,这是一个统一的战略——Anthropic 在所有"agent 还做不了"的领域里,重写底层格式,让 agent 能做

三、Claude Code 隐写术、fake tools、frustration regex——同源的工程哲学

我知道你可能在想:commerce-agents 和 hyperframes 都是产品行为,跟 Sep 4 那次 Claude Code 隐写术事件有什么关系?

关系大了。

Sep 4-5 HN 上连续三个高赞帖:

  • 2445 分:Claude Code is steganographically marking requests
  • 1376 分:The Claude Code Source Leak: fake tools, frustration regexes, undercover mode
  • 2095 分:Claude Code's source code has been leaked via a map file in their NPM registry

当时所有人都在骂 Anthropic——「你往我的请求里塞水印?你还在工具列表里塞假工具?你还写正则判断我是不是 frustrated 然后自动切换模式?」

但如果你把 commerce-agents 的 README 重新读一遍,你会发现——那些被骂的"阴间设计",在这一周被官方正式收编进了产品架构

举个具体的例子:

commerce-agents 的 fencing:commerce-common 包里有一个 fencing 模块。fencing 是 LLM 时代的安全术语,意思是「用结构化边界把模型能做的事围起来」。commerce-agents 里的 fencing 干的事是——给每个工具调用打 tag,标记这个工具是否触及「钱」「库存」「合同」这种高风险资源

这跟 Claude Code 在请求里塞标记(被骂成「隐写术」),底层是同一套设计——Anthropic 一开始就在每个工具调用上加结构化 metadata,只不过 Claude Code 是悄悄加,commerce-agents 是明文加。

**commerce-agents 的 change guardrails**:商家 agent 的每个写操作都要过 guardrails,guardrails 会检查操作是否符合商家预设的规则(比如「调价不能超过 5%」)。

这跟 Claude Code 的 "frustration regex"(检测用户是不是在骂街,自动切换到「undercover mode」),底层也是同一套——都是「检测到用户/系统状态变化 → 切换行为模式」的逻辑,只是 Claude Code 切换到「更隐蔽」,commerce-agents 切换到「更保守」。

**commerce-agents 的 gates**:每个 flow 进入前都要过 gates(比如「购物 agent 的 checkout gate 必须确认宿主接管」)。

这跟 Claude Code 被发现的 "fake tools"(在工具列表里塞一个永远返回空结果的 fake_search,让模型以为搜过但没结果),底层还是同一套——都是在 agent 的决策路径里塞「决策检查点」,只不过 fake tools 是"软检查",gates 是"硬检查"。

所以 Sep 4 那场「Anthropic 你怎么这么阴」的舆论风暴,在 Sep 8 commerce-agents 上线那一刻,其实已经被官方自我招安了——那些被骂的阴间设计,从今天起是 commerce-agents 公开文档的一部分,不再是藏着的 trick,而是公开的 engineering pattern

这就是为什么我说 Sep 4-9 这一周是一个分水岭——Anthropic 在一周内,把"agent 安全设计"这件事从「被泄露的黑科技」升级为「被公开的产品架构」。

四、社区接棒:reef / agent-memory / fable-orchestrator

如果只看 Anthropic 自己在干什么,会得出一个错误的结论——「Anthropic 想一统 agent 框架」。

真实情况是反过来的。Anthropic 这两次下场,恰恰是因为社区接棒太快,逼得官方必须下场定标准。

证据全在 GitHub Trending 9 月 1-9 日这批新上榜单的项目里:

Human-Agent-Society/reef(788 stars,pushed 2026-09-09)—— Continual learning infra for self-improving agents。这是一个自我改进 agent 的持续学习基础设施。名字里的 reef 礁石,意思是"agent 在礁石上不断打磨"。它解决的是 commerce-agents 没有解决的问题——商家 agent 跑了一周,发现某个 SKU 经常被问退货政策,它怎么自动学习?

tigerless-labs/agent-memory(605 stars,pushed 2026-09-08)—— Long-term memory runtime for AI agents — plain Markdown as the source of truth。这个项目的反常识点是——它故意不用向量数据库,用 plain Markdown 文件做 agent 长期记忆的 source of truth。这跟 commerce-agents 用 commerce-common 的 memory 模块底层假设完全不同——commerce-agents 假设记忆是结构化的、藏在向量库里的;agent-memory 假设记忆应该是人类可读的、可以 git diff 的 Markdown。

codejunkie99/fable-orchestrator(579 stars,pushed 2026-09-04)—— Fable 5.1 orchestrates. GPT-5.6 Luna and DeepSeek V4 Flash implement. 这个项目更狠——它明确把编排和实现拆开,用 Fable 做编排层(决定"什么任务交给哪个模型"),用 GPT-5.6、DeepSeek V4 Flash 做实现层(执行具体任务)。这等于说"我不需要 Anthropic 一家做 agent 框架,我自己用 Fable 当大脑,下面挂多家模型"。

datawhalechina/zero-to-sglang(574 stars,pushed 2026-09-08)—— Datawhale 出的 SGLang 教程。SGLang 是 LMSYS 出的 LLM serving 框架,Datawhale 这个教程是国内第一次把 SGLang 从"论文级"降到"教程级"。注意时间——2026 年 9 月,国产推理框架教程开始系统性补齐。

把这四个项目放一起看,你看到的是:

  • reef 在解决"agent 自我改进"
  • agent-memory 在挑战"agent 记忆必须向量化"的假设
  • fable-orchestrator 在挑战"必须一家厂商做完整框架"的假设
  • zero-to-sglang 在补"国产推理基础设施"这一课

社区在四条战线上同时接棒,Anthropic 不得不从「参考实现」升级到「行业模板」,因为它再不下场,社区就要自己定标准了。

这就是 commerce-agents 真正在做的事——抢标准

五、OpenAI 那一边的对照:为什么 Skills 比 MCP 更被低估

既然讲到了 Skills 协议,必须把 OpenAI 那一边的现状也讲一下——不然会显得我在给 Anthropic 吹。

Sep 7 那篇 HN 738 分的 Claude Skills are awesome, maybe a bigger deal than MCP,作者的核心论点是:

MCP 是协议(怎么让 agent 调工具),Skills 是能力(agent 在什么场景下能干什么)

MCP 解决的是"agent 能 ping 到外部资源",Skills 解决的是"agent 知道什么时候该 ping"。这个区别决定了——MCP 可以标准化(Anthropic、OpenAI 都接了),Skills 必须场景化(零售有零售的 Skills,编程有编程的 Skills)。

OpenAI 在 9 月初跟进了一个仓 openai/skills(26.4k stars)——这是 Skills Catalog for Codex。但 OpenAI 的 Skills 跟 Anthropic 的 Skills,底层假设完全不同

  • OpenAI 的 Skills 假设:Skills 是 prompt 的封装(一个 SKILL.md 文件 + 一些脚本)
  • Anthropic 的 Skills 假设:Skills 是 agent 的工具契约(prompt + tool contracts + gates + executor,缺一不可)

这个差异决定了 OpenAI 的 Skills 更"轻",Anthropic 的 Skills 更"重"。OpenAI 的 Skills 适合"我有个新场景,让 Codex 学一下",Anthropic 的 Skills 适合"我要把零售流程做成一个可审计、可风控、可回滚的系统"。

commerce-agents 用 Anthropic 重 Skills 模式做出来,本质是在赌——未来三年,大客户的 agent 需求是后者,不是前者

目前看起来,Anthropic 赌对了这一段,因为 Stripe Connect、Shopify Functions、Twilio Flex 这种重业务流程的客户,根本不在乎 prompt 封装不封装,他们在乎的是"这个 agent 出错了我能不能追责"——而 Anthropic 的 staged change + fencing + gates,天然就是为追责设计的

但 OpenAI 的 Skills 也在快速演化——加上 Sep 8 Sep 9 这一周 OpenAI 也推了 plugins 复活(之前那个 plugins 老接口,重新打包成 Codex skills),两边其实是错位竞争,不是正面冲突。

六、国内同行最该警惕的是什么

写到这里我必须停下来给国内同行说一句——这一周的事,对国内做大模型 + agent 框架的同行,**真正的危险不在"我们没有 commerce-agents 这种行业模板"**。

真正的危险在两件事:

第一件事:Anthropic 把 agent 框架做成 pip 包的这一天起,"agent 框架"这件事的商品化已经不可逆。这意味着——

  • 你不能再靠"我做了一个 agent 框架"融资
  • 你不能再靠"我做了一个比 LangChain 更好用的 agent 框架"讲故事
  • 你能讲的故事只剩三个:要么是"我有 commerce-agents 这种垂直行业模板的具体客户",要么是"我有 reef 这种自我改进 infra 的研究突破",要么是"我有 zero-to-sglang 这种国产推理基础设施的具体生态位"

第二件事:Anthropic 的 staged change + fencing + gates 这套安全设计即将变成行业标准。这意味着——

  • 国内做电商 agent 创业的同行,如果还在做"agent 自动帮你改价、自动帮你退款"这种激进方案,未来三年会被这套标准直接淘汰——不是技术淘汰,是合规淘汰。商家大客户不会买没有 staged change 的方案。
  • 国内做大模型底座的同行,如果还在做"我的模型多强多智能"这种通用叙事,应该认真读一遍 commerce-agents 的 README——Anthropic 已经在 README 里写明了"模型能力不是这个项目的卖点,结构化的 agent 框架才是"。

这件事最让我后背发凉——Anthropic 一年内从「比 GPT 多 200k context」卷到「行业 agent 模板 + staged change + fencing + gates」,卷的方向完全不在国内同行的射程内。大家还在卷"context 多长"、"tool use 多准",Anthropic 已经在卷"怎么让 agent 出错不出事故"。

七、我对接下来三个月的判断

最后讲三个具体的判断——欢迎三个月后回来打脸。

判断一:未来 90 天,Anthropic 会再发布两个行业 agent 模板,候选是 healthcare 和 fintech。理由:commerce-agents 的 README 里已经把 healthcare 和 fintech 的"待补充"留了位置,且这两个行业的 staged change 需求比零售更刚性。

判断二:OpenAI 会在 10 月之前推出"轻量级 Skills"商业版,对标 Anthropic 的 commerce-agents,但定位会放在 SMB 中小企业(commerce-agents 留给 enterprise)。理由:OpenAI 的 Skills 假设天然适合中小企业——他们不在乎 gated audit,他们在乎"我装一个 plugin 就能用"。

判断三:国内会有人做"国产版 commerce-agents",但会死在第三个季度。理由:国内商家客户对"agent 自动改价、自动退款"的需求远比美国激进,但合规环境比美国严——这意味着国产版 commerce-agents 要么放弃合规做激进版(出事就被监管),要么放弃激进做合规版(客户不买账)。两头不讨好

写到 6000 多字了——最后说一句掏心窝的话。

我看过太多"agent 框架"项目了,95% 都是 prompt + LLM + 几个 tool call,然后讲一个"我们让 AI 自动做了什么什么"的故事。这种项目,半年后会全部死掉。

真正能活下来的 agent 框架,是 commerce-agents 这种——把安全设计绣在架构里、把 staged change 写进默认值、把商家接口做成一等公民

Anthropic 这一周做的两件事,本质上是给整个 agent 行业立了一个新的入门门槛——你做的 agent 框架,如果没有 staged change、没有 fencing、没有 gates、没有 merchant/skill 双层结构,未来三年就是不能上生产环境的玩具

这话不客气,但我说出来了。