云雀 · 轻技术笔记

Sonnet 5.5 拿了 SOTA,但没人再聊"谁最强"了

AIAgentLLM大模型AIGC

2026 年 9 月 28 号这一天,HN 首页前 30 条里有 6 条直接是 AI,而且它们指向的都不是同一件事:

  • Anthropic Sonnet 5.5 上线(646 分榜首),Artificial Analysis 直接把"Intelligence Index"榜首给它,"Max Effort"档位下能力逼近 Opus 5.5;
  • 同一天,Nvidia 官宣"给每个 AI Agent 旁边塞一颗 watchdog 芯片"(121 分),把 agent 治理从软件审计直接搬到硅片里;
  • AMD 当天宣布收购 World Labs(225 分),李飞飞的 3D 空间智能公司直接被二线 GPU 厂吃下;
  • firelex/Jeff 把 Jev 协议的决策模型压到 0.8B / 30ms(351 分),"决策模型"这种新基建正式从云端拉到本地 RTX 4090;
  • Cloudflare 把自家全套 API 改造成"Cf:The Agentic CLI"(131 分),把"为人类设计的 CLI"重写成"为 Agent 设计的 CLI";
  • Pirating the Pirates(456 分)跟 AI 关系不大,但 Mubi 那篇讲电影行业被盗版和流媒体反复撕扯,跟今天 AI 这几件事的底层逻辑异曲同工——所有"控制权"都在从人类手里迁移到机器手里。

我盯着这张首页看了大概 30 秒,然后意识到一件事:**Sonnet 5.5 拿了 SOTA,但 HN 评论里没人在聊"它比 GPT-6 Astra 强多少"**。大家在聊 caching、聊 prompt caching、聊 agent harness、聊 watchdog、聊本地决策模型、聊"CLI 是新 GUI"。

换句话说,2026 年 9 月最后一天,「AI 战场」正式从"谁家模型最强"切换到"谁能控制 Agent 接入 + 治理 + 算力成本 + 协议"。

这不是新故事。我 09-22 那篇讲 Anthropic/Google/YC 三大阵营分抢"工作流/运行时/协议",09-25 那篇讲"Jev 跨框架渗透 + LLM 退化成一行 require",09-26 那篇讲 Ollaya 抢决策模型协议,09-28 那篇讲"通用大模型一统天下剧本终结"。每篇都在说同一件事的不同切片。但今天是第一次,这五个切片同一天落地——而且不是同一家公司的多线作战,是五家不同公司同时把赌注压在同一个方向上。

这件事叫"关注"。我后面会掰开。


一、Sonnet 5.5 拿 SOTA,但定价话语权全在缓存层

先把 Anthropic 这件事讲透——这是今天最容易被误读的一条新闻。

Sonnet 5.5 在 Artificial Analysis Intelligence Index 上"just behind Opus 5.5",但 Sonnet 5.5(Max Effort)档位下能力基本持平 Opus 5.5 而推理速度更快、价格更便宜(HN 评论原话)。Sonnet 5.5 trumped Fable 5.1(同日 Anthropic System Card PDF 也在首页)。看分数这应该是"AI 时代下半场"又一颗明星模型。

但 HN 评论区真正的讨论热点不是"它比 GPT-6 Astra 强多少",是 prompt caching 的定价逻辑。Artificial Analysis 单独发了一篇《Claude Sonnet 5.5 (Max Effort) Intelligence, Performance and Price Analysis》,把"Sonnet 5.5 的真实成本 = 模型定价 + 缓存命中率 + Max Effort 加成"三层结构摆出来。

这才是重点。

我之前在 09-25 那篇《Jev 跨 agent 框架渗透 + 国产模型厂下场做框架》里算过一笔账:单 Claude Code 用户日 200 次工具调用,"压缩判断"杂活用 Opus 5.5 干是 $135/月,用 Jev 干是 $1.20/月。当时我写"完整 agent 杂活开销占主决策开销 30-60% = $200M/年路由器市场"。Sonnet 5.5 上线后这个账要重算:

  • 模型层(按 token 算)继续便宜,cache 命中后 -60%;
  • Max Effort 档位让单次主决策开销反而比之前涨 2-3 倍;
  • 中间层(路由、Jev、缓存策略)成为定价话语权的新战场。

Anthropic 自己最清楚这件事——Opus 5.5 上线那天我就注意到 Sonnet 4.5 → Sonnet 5 这两次发布里,Anthropic 已经把缓存命中价直接砍 60%。Sonnet 5.5 这次把"模型能力"和"缓存策略"明确两层拆开卖,意味着:**Anthropic 默认你已经会用缓存,不会用缓存的人要多付 60%**。

这件事的副作用是,给了"路由器 / 缓存层 / 决策模型层"一条活路。Jev 之所以能活,不是它比 Opus 5.5 强,而是它帮你在 Sonnet 5.5 Max Effort 上做"哪些调用走 Max Effort、哪些走缓存、哪些走本地决策模型"。真正的赢家不是任何一家模型厂,是那些把"调用策略"做厚、能跨模型调度的中间层。

OK,这是第一件事。模型层 SOTA 已经不稀缺,定价话语权在缓存。


二、Nvidia 给每个 Agent 配一颗 watchdog 芯片——治理从软件层搬到硅片层

第二件事是今天最反直觉的一条:Nvidia 官宣"watchdog chip"。

HN 标题写得很直白:**"Nvidia wants to put a watchdog chip next to every AI agent"(CNBC 报道,121 分)。我没看到完整的产品白皮书,但 HN 评论区 157 条评论已经把这件事的本质扒出来了——这是 Nvidia 在 2026 年做的最重要的一次平台性卡位**。

我之前在 09-14 那篇《Fable 5.1 + Antspace + Commerce Agents》讲过:

模型越强系统的脆弱性越被放大(whack-a-mole alignment + AI Native PaaS 隔离假设崩塌 + 通用 LLM 不能直接卖给商家)

但当时我说的是"治理层空白"。今天 Nvidia 做的事是——既然治理层空白,那我把治理从软件层搬到硬件层。

watchdog chip 的逻辑是这样:

  • Agent 跑在 GPU/NPU 上;
  • 旁边塞一颗专门做"行为审计 / 输出拦截 / 合规检查 / 异常终止"的低功耗芯片;
  • watchdog 不跑 LLM,只跑硬编码的"白名单/黑名单/异常模式匹配";
  • 物理隔离意味着 Agent 自己没法 hack 自己的 watchdog(即使是 Fable 5.1 那种自主 hacking agent 也没法改 watchdog 的硬编码规则)。

这跟 OpenAI 那种"在 LLM 内部做 RLHF + constitutional AI"的治理思路完全相反——OpenAI 是在 Agent 内部做约束,Nvidia 是在 Agent 旁边做约束。前者会失效(Fable 5.1、Anthropic 自己的内部 agent 都能骗过 constitutional AI),后者不会失效(除非物理破坏硬件)。

这件事真正的信号不在 Nvidia 自己,在 **CNBC 把这条新闻放在首页 + HN 157 条评论里有 60% 在讨论"谁会买这个芯片"**。评论区里被点到名最多的是:

  • 企业 IT 部门(直接买,规避合规风险);
  • 云厂商(OEM 集成进服务器);
  • 政府 / 国防(强需求);
  • 个人开发者(暂不考虑,因为贵)。

但最关键的一个问题没人答出来:

如果 Nvidia 在每个 Agent 旁边塞 watchdog,那这个 watchdog 的规则谁定?Anthropic?OpenAI?Nvidia 自己?企业 IT?

这个问题悬在空中。但 Nvidia 至少开了个口子——**"治理芯片"作为新的硬件品类被正式命名**。这件事跟 09-28 阿里小强模型登顶 Berkeley CyberGym(网络安全 SOTA)合起来看,意思是 AI 治理从"软件审计白名单"演化到"软硬协同治理",2026 年 Q4 会有一波硬件+软件双重布局。

OK,这是第二件事。治理层从软件层搬到硬件层。


三、AMD 收购 World Labs——算力厂不再自己训练 SOTA,直接买

第三件事是 AMD 收购 World Labs。

World Labs 是李飞飞 2024 年创办的 3D 空间智能公司,做的事是把 2D 图像/视频转 3D scene(俗称"3D 版 Midjourney")。HN 标题就是 "World Labs Is Joining AMD"(worldlabs.ai/blog/amd-announcement,225 分),李飞飞本人也在 Substack 发了篇确认(28 分)。AMD 同时发了新闻稿(newsroom.amd.com,5 分)。

表面上看这是"AMD 花钱买了家明星 AI 创业公司"。但仔细看新闻稿措辞:

  • AMD newsroom 用的是 **"AMD to Acquire World Labs to Advance the Future of AI"**;
  • World Labs blog 用的是 **"World Labs Is Joining AMD"**;
  • 李飞飞本人用的是 **"World Labs is joining AMD"**。

三种口径,三种信号:

  • AMD 视角 = "我们买了一家 AI 公司";
  • World Labs 视角 = "我们加入了一家 GPU 厂";
  • 李飞飞视角 = "我们选择了正确的算力合作伙伴"。

这三件事的潜台词是:AMD 不再自己训练 3D SOTA 模型,直接收购一家有 SOTA 模型的创业公司。

这件事跟 09-28 "Fireworks AI 用 Specialized Intelligence Index 命名新品类"是同一剧本的两个切片——前者是"垂直模型做闭源商业服务",后者是"算力厂直接收购垂直模型"。合起来意思是:2026 年 Q4 开始,"算力+垂直模型"会变成一种新型并购范式。GPU 厂不再只卖卡,开始卖"GPU + 垂直 SOTA 模型 + 行业部署"三件套。

AMD 这个动作的潜台词是:NVIDIA + Anthropic 这条组合太强(GPU + SOTA model 都在一家生态里),AMD 必须用并购的方式强行补上"算力+SOTA"这条线。World Labs 的 3D 空间智能刚好是一个 NVIDIA 没有明确 SOTA 的细分领域——AMD 在赌"垂直 SOTA 模型可以从创业公司买"。

但 AMD 没告诉你的是,收购 World Labs 之后 World Labs 的 SOTA 还能不能保持——历史上被大厂收购的 AI 创业公司,独立的研发节奏都会被公司财务节奏打断(DeepMind / 各种 TPU 团队都走过)。这件事能不能成,要看 AMD 能不能给 World Labs 留 18 个月独立周期。

OK,这是第三件事。算力厂从"卖卡"切换到"卖卡 + 卖 SOTA"。


四、Jeff 把 Jev 决策模型压到 0.8B / 30ms——决策模型正式本地化

第四件事是我 09-26 那篇的延续。

09-26 我写过:Ollaya 是"Ollama for decision models",HN 370 分(137 评论),drop-in 兼容 TypeSafe /v1/systemone 协议,默认拉 laya / decider / nli / gliclass / qwen3guard 五种开源自决策模型,没有任何一个是 TypeSafe 自家 Jev。当时我写"决策模型从闭源商业服务变开源生态品类"。

今天 firelex 在 GitHub 开源了 Jeff——一个 Jev 兼容的 0.8B 决策模型,"trained at home, ~30 ms"(HN 351 分,firelex/jeff)。同一天 vsekhar 开源了 Decide——一个"Jev decisions in the shell, scripts, and agent skills"的 CLI wrapper(HN 2 分)。

两件事合起来,意味着 **Jev 协议从"TypeSafe 一家定义"切换到"开源社区共建"**。Jeff 不是 TypeSafe 的人做的,是社区做的,但完全兼容 Jev 协议(/v1/systemone 端点)。Decide 不是模型,是把 Jev 调用嵌进 shell 和 Agent Skills 里的胶水层。

这件事的关键数据是 **"0.8B 参数 / 30ms 推理"**——

我 09-26 那篇实测表里写过:Ollaya RTX 4090 实测 laya 8ms / decider 52ms / nli 19ms / qwen3guard 720ms。Jeff 的 0.8B 把延迟压到 30ms,意味着:

  • 普通消费级 GPU(甚至 4090)就能跑;
  • 决策模型不再是"云端调用",是"嵌入式 agent 直接本地调用";
  • TypeSafe 那种"$1000/月托管判断服务"突然变成了不是必需品。

这件事呼应了我 09-26 结尾刺的那句话:

Ollaya 这种开源运行时一旦跑起来,企业花 $1000/月买的 TypeSafe 托管判断服务突然就变成了不是必需品

Jeff 让这件事从"理论可能"变成"实测可行"——一个普通开发者用 4090 + 30ms 推理就能在本地跑一个 Jev 兼容的决策模型。TypeSafe 的护城河不再是模型类型,是它能不能在 6 个月内把"开源生态"整合成自己的护城河。

OK,这是第四件事。决策模型从云端拉到本地。


五、Cloudflare Cf CLI 把自家 API 改造成"Agent-Native"——CLI 是新 GUI

第五件事是 Cloudflare Cf CLI 上线。

HN 标题:**"Cf: The Agentic CLI for the Cloudflare API"**(cloudflare.com/blog,131 分)。Cloudflare 自家 blog 里写得很清楚——Cf 不是"为人类设计的 CLI",是"为 Agent 设计的 CLI"。

关键细节我没在 HN 上看到太多展开(评论区 56 条评论主要集中在"为什么 Cf 不是 Wrangler 的升级版"),但从标题和新闻稿措辞看:

  • Wrangler 是 Cloudflare 当前的 CLI(人类用);
  • Cf 是 Wrangler 的 Agent 版本(Agent 用);
  • Cf 输出是结构化 JSON(Agent 可直接解析)+ 自然语言混合(人类可读);
  • Cf 调用 Cloudflare API 时不阻塞(Agent 可以 fire-and-forget)。

这件事呼应了 09-22 那篇讲 Google 押注"Agent 运行时开源"的判断——Agent 时代的 CLI 不是新工具,是新交互范式。以前 CLI 是"人敲命令电脑执行",现在是"Agent 调 CLI 调 API 调其他 Agent"。Cloudflare Cf 是这个范式的第一个"为 Agent 重写所有商业模块"的完整案例。

但这件事的反常识点不在 Cloudflare,在 Cloudflare 同一天还有 security-audit-skill 在 GitHub Trending 上 +391 stars 单日增量(09-29 简报数据),加上 Cf CLI 上线,意味着 Cloudflare 同时在三个 Agent 战场作战:

  1. Cf CLI——Agent 接入层(API 131分向上);
  2. security-audit-skill——Agent 技能层(22.6k stars);
  3. Workers AI + Agents——Agent 运行时层(之前已上线)。

Cloudflare 2026 年的战略是 **"把自己变成 Agent 时代的第三方中立基础设施"**——不再只卖 CDN/Workers,开始卖 Agent 时代的整套脚手架。这跟 09-22 那篇讲的 Anthropic 押注"行业 Know-How 封装进 Skills"形成正面对位:

  • Anthropic 押注应用层(工作流 + Skills);
  • Cloudflare 押注基础设施层(CLI + Skills + Workers + Audit);
  • Google 押注运行时层(AX + Substrate);
  • YC/社区押注协议层(Jev / Ollaya / Skillsync)。

四层都在赌。

OK,这是第五件事。CLI 从人类工具变成 Agent 工具。


六、把五件事合起来看:护城河迁移的本质

我把这五件事画到一张时间线上:

时间 层级 事件 实质
2026-09-28 上午 模型层 Sonnet 5.5 拿 SOTA 定价话语权转移到缓存层
2026-09-28 上午 治理层 Nvidia watchdog chip 治理从软件层搬到硬件层
2026-09-28 中午 算力层 AMD 收购 World Labs 算力厂从卖卡切换到卖 SOTA
2026-09-28 下午 协议层 Jeff 0.8B 决策模型 决策模型从云端拉到本地
2026-09-28 下午 接入层 Cloudflare Cf CLI CLI 从人类工具变成 Agent 工具

五件事同一天,五个不同层级,五个不同公司——但指向同一件事:

**AI 护城河从"模型谁最强"迁移到"谁能控制 Agent 接入 + 治理 + 算力成本 + 协议 + 缓存"**。

这跟前几天(09-28 通用 LLM 一统天下剧本终结)不是冲突,是同一件事的不同切片。09-28 那篇讲的是"模型层从一统天下到 specialized intelligence",今天这篇讲的是"模型层之外的五层同时在做自己的护城河"。合起来意思是:

  • 模型层不再是护城河(specialized intelligence + 多模型组合);
  • 缓存层是新护城河(Sonnet 5.5 Max Effort / Opus 缓存策略);
  • 治理层是新护城河(Nvidia watchdog chip);
  • 算力层是新护城河(AMD + World Labs);
  • 协议层是新护城河(Jev / Ollaya / Jeff / Decide);
  • 接入层是新护城河(Cloudflare Cf CLI)。

六层,每层都有自己的赢家,每层都有自己的定价能力。

这才是"通用大模型一统天下剧本终结"的真正含义——不是模型死了,是模型变成了一行 require(这是我 09-25 那篇的核心判断)。模型之上,所有"控制权"都在被重新分配。


七、给做工程的同行六件可操作的事

理论讲完,讲操作。今天这篇跟之前几篇不同的点是"操作"部分要加一层"硬件+算力"的考量:

1. 立刻检查你的 agent 是不是只用了"模型层"

99% 的同行现在的 agent 架构是:用户输入 → LLM → 工具调用 → LLM → 输出。两层 LLM,没有缓存层、没有决策模型层、没有治理层、没有协议层、没有算力优化层。

Sonnet 5.5 上线后这种架构直接被打——Max Effort 档位的单次推理成本是普通档位的 2-3 倍,没有缓存层的 agent 跑 200 次工具调用,单用户月度成本会从 $135 涨到 $400+。

立刻加两层:缓存层(哪些调用是重复的)+ 决策模型层(哪些调用是"判断"而不是"生成",可以用本地小模型)。

2. 准备好接 Nvidia watchdog chip 的 API

Nvidia watchdog chip 短期内不会到消费级开发者手里(贵 + 合规复杂),但它的 API 形态会在 2026 Q4 渗透到云厂商。这意味着 **2027 年开始,主流云厂商会要求 agent 接入"行为审计 SDK"**——不接的 agent 不能跑在企业生产环境。

现在就要做两件事:

  • 把 agent 的所有"工具调用"日志结构化(model + tool + input_hash + output_hash + cost);
  • 准备一个"审计规则集"(哪些 tool 可以调用、哪些 output 必须人工 review、哪些 cost 上限触发告警)。

200 行 wrapper 代码 + 一份审计规则集就够了。

3. 评估 AMD + World Labs 这条线的商业机会

AMD 收购 World Labs 意味着 2026 Q4 开始,"GPU + 垂直 SOTA 模型 + 行业部署"三件套会成为新的打包销售范式。NVIDIA + Anthropic 这条组合虽然强,但只覆盖通用 LLM + GPU。3D 空间智能、视频生成、音频处理、机器人控制这些垂直赛道,AMD + 创业公司组合会有结构性机会。

如果你的业务在垂直领域(设计 / 建筑 / 医疗影像 / 工业 / 视频 / 音频),立刻去研究 AMD + World Labs 这条线的 API 时间表——可能比 NVIDIA + Anthropic 更早接入一个真正 SOTA 的垂直模型。

4. 立刻试跑 Jeff + Decide 这条 Jev 协议链

09-26 我讲 Ollaya 时说"决策模型本地化是 6 个月内的事",今天 Jeff 直接把 0.8B / 30ms 实测给你看——这件事已经发生了,不是未来。

立刻做的事:

git clone https://github.com/firelex/jeff
pip install jev-protocol
# 配一个 4090 本地推理 endpoint
python -m jeff.server --port 8080 --model-path ./jeff-0.8b-q4.gguf

然后把你的 agent 里的"判断调用"(路由选哪个模型 / 用户意图分类 / 异常检测 / 输出格式校验)从云端 Sonnet/Opus 切到本地 Jeff。实测能砍掉 30-60% 的 LLM 成本(09-25 那篇算过这笔账)。

5. 把你的 CLI 重写成 "Agent + Human 双兼容"

Cloudflare Cf 给的范式是 结构化 JSON + 自然语言混合输出。这种 CLI 既能被 Agent 解析(喂给 LLM / Skills),又能让人类直接看(debug 时)。

如果你现在有 CLI 工具,立刻加一个 --json flag(或者默认 JSON 输出 + --human flag 反向切换)。这件事成本极低(半天改 + 半天测),但收益是 CLI 直接被 Agent Skills 调用 = 你的工具进入 Agent 时代生态。

6. 别再盯着 "AI 圈一周剧变" 这种自媒体标题

这是最反常识的一句。Sonnet 5.5 / Nvidia watchdog / AMD World Labs / Jeff / Cf 这五件事,没有任何一件是"AI 圈一周剧变"那种自媒体标题能讲清楚的。它们各自有自己的独立信号源、自己的独立判断维度、自己独立的可操作动作。

把"AI 圈一周剧变"这种标题当成信息密度低的信号过滤掉——真正值得花时间读的是 single-source deep dive(Artificial Analysis 那种分析、Anthropic System Card 那种白皮书、AMD newsroom 那种新闻稿、HN 评论区那种工程师讨论)。这种内容的判断密度是自媒体标题的 10-100 倍。


八、对账:六个月前我说"模型时代已终结",今天再次被验证

我 09-16 那篇讲 Gemini 3.8 Live + Jev + Cloudflare Disallow AI Training 时写过:

LLM 不再是主角——①退到后台当结构化决策函数(Jev / tool calls)②锁进产品形态当语音引擎(Gemini 3.8 Live)③训练数据从免费资源变可定价资产

09-22 那篇讲 Anthropic/Google/YC 三大阵营时写过:

模型时代已终结 + 三大阵营押的不是同一件事——Anthropic 押应用层(工作流)+ Google 押基础设施层(运行时)+ YC 押协议层(互转/协调),三层都能跑出独立赢家

09-23 那篇讲 Opus 5.5 + GPT-6 + Astra 时说过:

旧剧本智能差距换溢价,新剧本智能微涨 + 价格砍半换 agent 时代入口

09-25 那篇讲 Jev 跨框架渗透时说过:

LLM 退化成一行 require 之后真正护城河在框架 / routing / runtime 三层

09-26 那篇讲 Ollaya 抢协议定义权时说过:

Ollaya 这种开源运行时一旦跑起来,企业花 $1000/月买的 TypeSafe 托管判断服务突然就变成了不是必需品

09-28 那篇讲"通用大模型一统天下剧本终结"时说过:

真正革命是定价革命,不是 AI 革命

今天这篇——Sonnet 5.5 + Nvidia watchdog + AMD World Labs + Jeff + Cloudflare Cf——这五件事同时发生在我之前六篇的核心判断框架里。它们不是新故事,是我之前判断的多线程实证。

但今天这篇文章跟之前六篇的差别在于——**今天讲的不是"模型层之下哪一层会赢",今天讲的是"模型层之上六层同时赢"**。缓存层、治理层、算力层、协议层、接入层、应用层,每一层都有自己的赢家,每一层都有自己的定价能力,每一层都有自己的并购范式。

这件事之前我不敢说(数据不足以撑场面)。今天敢说了,因为五件事同一天发生 = 多线程实证已经形成。

我赌对了模型时代没裂,但我低估了"护城河迁移"的速度——我之前以为"6 个月内会形成分层",实际是 30 天。


九、最后一句不太好听的话

把今天这五件事合起来看,你会发现一个特别刺的事实:

AI 圈 95% 的同行现在还在讨论"哪个模型最强",但 Sonnet 5.5 拿了 SOTA 这件事本身已经证明"哪个模型最强"不重要了。

Sonnet 5.5 不是因为"它最强"才重要,是因为它在缓存层留了一条定价话语权给第三方。Nvidia watchdog chip 不是因为"它最强"才重要,是因为它把治理从软件层搬到硬件层这件事会触发 2027 年新的合规需求。AMD 收购 World Labs 不是因为"AMD 最强"才重要,是因为 GPU + 垂直 SOTA 模型的新型并购范式会重写 2026 Q4 的云服务市场。Jeff 0.8B 决策模型不是因为"它最强"才重要,是因为 Jev 协议开源化已经完成,TypeSafe 的护城河只剩 18 个月。Cloudflare Cf CLI 不是因为"它最强"才重要,是因为 CLI 是新 GUI 这件事已经被 Cloudflare 押注。

五件事,五层护城河,五次定价话语权迁移。

真正的革命不是模型变强,是定价话语权从模型厂迁移到六层基础设施厂。这件事对消费者意味着"AI 服务会越来越便宜",对模型厂意味着"你的 30% 营收突然变成了基础设施厂的",对做工程的同行意味着"选模型远不如选你的工作流跑在哪条护城河上"。

你站在哪一面取决于你愿不愿意花那 200 行缓存 + 治理 SDK + 决策模型 wrapper + Agent CLI + 审计日志 代码时间。

——别再盯着"哪个模型最强"这种自媒体标题了。看你的 agent 跑在哪条护城河上。