云雀 · 轻技术笔记
2026 年 9 月模型双首发日:Opus 5.5 / GPT-6 Sol 砍价 40-50% 的背后,Agent 时代定价权之战才刚开始
写这篇的时候,HN 首页前 30 条里有 4 条同时登顶:Anthropic Claude Opus 5.5 (1304 pts, 859 评论)、OpenAI GPT-6 Sol and Luna (1290 pts, 646 评论)、GPT-6 Astra 破 Enigma (590 pts, 371 评论)、OpenAI is well positioned to fast-follow Jev (271 pts, 196 评论)。
上一次 HN 首页出现「两家顶级实验室同日发模型」+「同日破古典密码悬案」的奇景,要追溯到 GPT-4 vs Gemini 1.0 那个月。但今天的特别之处不在「模型又回来了」,而在「回来的模型全在砍价」——Opus 5.5 输入 token 比 Opus 5 便宜 20%、输出便宜 20%、cache 读便宜 60%;GPT-6 Sol/Luna 直接腰斩对折,Sol 从 $4/$20 砍到 $2/$10,Luna 从 $0.20/$1.20 砍到 $0.10/$0.50。
昨天我写了一篇《Agent 时代三大阵营正面交锋》,核心判断是「模型时代已终结,三层押注(应用层 / 基础设施层 / 协议层)各自抢地盘」。今天的模型双首发直接把这条判断打回原形——不是模型时代终结了,是定价权被重新洗牌了。Anthropic 和 OpenAI 在 24 小时内用「能力微涨 + 价格砍半」的双刀,把整个行业的定价权基准线往下砍了一截。
这就是今天值得掰开讲的硬故事。
1. Opus 5.5:不是「更强」,是「更便宜地变强」
Anthropic 官方页面今天贴出来的核心数字不是 SWE-bench 跑分,而是这几行:
Opus 5.5 requires less compute to serve than Opus 5, and its pricing reflects that. Our tests show that at default settings it will cost 40% less than Opus 5 on typical workloads. Input and output tokens are $4 and $20 per million, 20% less than Opus 5. Cache reads (which make up the majority of agentic and coding work costs) are $0.20 per million tokens, 60% less than Opus 5. Opus 5.5 also generates output more than 30% faster than Opus 5.
把这段翻译成人话:Opus 5.5 比 Opus 5 能力略强(Artificial Analysis 评分 58 vs 53),但单次任务成本降 40%;在 agent/coding 场景里最贵的 cache 读,直接砍掉 60%。生成速度提 30%——对一个能跑 30 分钟以上的 agent 来说,30% 速度提升意味着用户感知的等待时间从「刷会儿手机」变成「倒杯水」。
测试用例里那个「680,000 行代码迁移,一天搞定」的故事才是真信号。这种量级的迁移,以前要工程团队干几周;Opus 5.5 用一天解决,而且大概率没人需要介入纠错——Anthropic 在告诉企业客户:这不是 demo,这是生产级。
但更值得琢磨的是同时发的另两个数字:
- 39 of 40:在「砍掉 web app 所有页面加载时间」这个任务上,Opus 5.5 成功 39 次,Opus 5 虽然也能砍,但会把应用行为也一起改了——5.5 的「边界感」明显强了一档。
- alignment audit 史上最强:Anthropic 自动行为审计(几千个模拟场景)里,Opus 5.5 是得分最高的模型。「hard-to-reverse actions」概率更低,「越界」概率更低,prompt injection 抵抗力更强。
这两个数字组合起来讲的故事是:不是 Opus 5.5 比 Opus 5 强了 20%,而是 Opus 5.5 在企业生产环境最关心的两件事(改东西不破坏现状、agent 不会失控)上明显进了安全区。
为什么这事儿对开发者重要:Anthropic 在 9 月 22 日同步放开了 5 小时用量上限和「rate limit reset」,允许订阅用户把额度存起来在忙时用。这等于把 OpenAI 的「burst pricing」思路学了过去——Agent 工作流里那种「平时不动、关键节点跑 30 分钟」的负载特征,需要这种弹性,而不是按月平均的固定配额。
2. GPT-6 Sol and Luna:对折刀法,把 Pareto frontier 抢回来
OpenAI 同日发的 GPT-6 Sol + Luna 走的是另一种刀法:价格对折,能力持平或微涨。
Artificial Analysis 的核心数字:
- Sol 输入 token 从 $4 砍到 $2,输出从 $20 砍到 $10,腰斩;
- Luna 从 $0.20/$1.20 砍到 $0.10/$0.50,也是腰斩;
- 但 Intelligence Index 评分和 GPT-5.6 基本持平(略涨 1 个点);
- Coding Agent Index 里 Sol 涨 2 个点(57 vs 55),Luna 反而掉 2 个点(41 vs 43);
- Sol 在 AA-Omniscience 幻觉率从 92% 砍到 60%(主动拒绝回答 17% 的问题换来的);
- Luna 幻觉率从 93% 砍到 77%。
这个组合透露出来的产品策略是:**让 Sol 去抢「Pareto frontier 上」的中端位置(57 分能力 + $2/task,3 倍性价比),让 Luna 去抢「纯价格战」的底端(Luna (max) 单任务 $0.07,比 GPT-5.6 Luna 便宜 60%)**。
但同一份测评里有个让 OpenAI 自己都不得不说的硬伤:
Both models regress in GDPval-AA v2.1 at max effort, driven by shorter deliverables that more often omit required elements.
Sol 在 GDPval-AA v2.1(OpenAI 自己数据集、经济价值高的 44 个职业任务)上掉了约 100 Elo,Luna 掉了约 75。Artificial Analysis 团队人工抽检了几百份模型输出,发现「掉分主要是因为交付物变短、经常漏掉评分标准里的必需项」。
这意味着:Sol/Luna 不是「更强的 GPT-5.6」,而是「更便宜、但会偷工减料的 GPT-5.6」。在 agent 场景里这是双刃剑——agent 拼的是「能不能在更少上下文里完成更多步骤」,能力持平但价格砍半的模型刚好是 agent 时代的甜点;但生产环境里跑长任务、需要严格按 rubric 交付的团队,可能会发现自己要写更多「防止 agent 偷工减料」的护栏。
为什么这事儿对开发者重要:Luna (max) 单任务 $0.07,意味着一个 30 步的 agent 工作流跑下来大约 $2——比雇一个临时工一个小时便宜 100 倍。这是「agent 廉价化」在 2026 年 9 月的真实价格标签。Anthropic 用 Opus 5.5 cache read $0.20/M tokens 卡低频 cache 成本,OpenAI 用 Luna 单任务 $0.07 卡「能跑就能上」的入门价——两家殊途同归到「让 agent 跑起来不再贵」。
3. Astra 解 Enigma:不是「AI 更聪明」,是「AI 更敢查资料」
HN 第三高分的「OpenAI GPT-6 Astra breaks Enigma message that has resisted solution since 2003」讲的故事更微妙。
Astra 在 9 月 21 日跑通了之前一直解不开的德军 1941 年 Enigma 密文。这条密文是 2003 年由两位业余密码学家发现并发布的,长期被认为「以传统密码分析无法破译」——因为它只有 62 个字符,信息论上信息量不够推回出钥匙。
社区分析后给出的解释大致是:Astra 不是用了什么神奇的密码学突破,而是:
- 训练数据里大概率有这部分 Enigma 密文的相关讨论(包括 2003 年原帖、2014 年的后续分析等);
- 在「Cyber General」模式下并行采样多种假设,选最自洽的;
- 把「完整解」拆成「先验 + 候选」两步,避免一次性穷举爆炸。
听起来不是突破对吧?但这里有个被忽略的反转:Astra 在「低智能指数 + 高并行能力」的组合下,能干过去只能跑「高智能指数 + 串行推理」的模型做不出来的任务。
这就是「模型时代」没有结束、而是「换皮」的真实信号——
- 旧版模型时代拼的是「单次推理能力」,benchmark 跑分压倒一切;
- 新版模型时代拼的是「能不能用工具、能并行多少、敢不敢拒绝回答」,单次推理可能比 GPT-5.6 还差,但带工具 + 带护栏 + 带并行的总分爆表。
Sol 在 AA-Omniscience 幻觉率砍到 60% 的方法论——主动拒绝回答 17% 的问题——和 Astra 能解 Enigma 的方法论是同源的:知道什么时候该闭嘴、什么时候该开多线并行,比单次回答多准一个点更重要。
为什么这事儿对开发者重要:你今天在用的「agent harness」(Claude Code / Codex / Hermes Agent)如果不支持并行子任务、不支持工具调用前的拒绝机制、不支持「先验 + 候选」两步拆解,你拿到的模型能力就只发挥了 60%。Opus 5.5 的 40% 降本里,可能有一半来自「agent 知道什么时候该停」。
4. Jev fast-follow + Unreal Agent:第三种打法在抢同一片战场
HN 第四、第五高分的两条值得放一起看:
OpenAI is well positioned to fast-follow Jev (271 pts) — Diogo Almeida(前 OpenAI 联合创始人)做的 Jev,核心是 RLCD 训练 + 并行采样 + type-safe 结构化输出 + 校准置信度。Artificial Analysis 上个月测评显示:Jev 输出「too cheap to meter」级别便宜(单次决策 70-500ms,比通用 LLM 便宜 40-200 倍)。
HN 评论区对 OpenAI「fast-follow」Jev 的判断是:OpenAI 完全有能力在 6 个月内复刻 Jev 的核心能力(type-safe + 低成本),但不会立刻做,因为现在还在用通用 LLM 卖高价。换句话说,Jev 这类「专用决策模型」的存在本身,就是通用 LLM 高定价的天花板。
Unreal Agent – frontier performance at 60% cost (146 pts) — 来自 Unreal Labs 的新模型,主打「frontier 性能 + 60% 成本」。Twitter 上吹的挺响,但 HN 评论两极分化——有人说「这是又一波小模型冲 frontier」,有人说「60% 是营销话术,实际是 75%」。
这两条加在一起的信号很清楚:frontier 模型的价格弹性正在被双向压缩——
- 上有 Anthropic Opus 5.5 这种「能力持平 60% 价格」的打法;
- 下有 Jev 这种「专用模型 + 100x 便宜」的打法;
- 旁边有 Unreal Agent 这种「frontier 70% + 60% 价格」的打法。
头部实验室之间的价格战不是「互相砍价」,是「被专用模型和小模型一起夹击」。Opus 5.5 砍 40% 不是因为 Anthropic 心善,是因为如果他们不砍,Jev 们会把 agent 的标配切换走;Luna 砍 60% 不是因为 OpenAI 突然变得亲民,是因为 LLM 的 token 单价正在以每 6 个月腰斩的速度被工程化。
5. 三条主线合并:Agent 时代的定价经济学长什么样
把上面四件事串起来,2026 年 9 月的模型市场已经形成清晰的三层定价结构:
第一层:前沿通用模型,定价由「对折速度」决定
Opus 5.5 比 Opus 5 便宜 40%、GPT-6 Sol/Luna 比 GPT-5.6 便宜 50%——这已经不是「老客户折扣」了,是新一代产品的出厂价。Anthropic 和 OpenAI 在用「每 6 个月对折」的节奏打价格战,谁先撑不住谁就先被收购或被市场抛弃。
这条线的赢家是能扛住 6 个月对折 + 12 个月发布的实验室。Anthropic 在融资 + 技术节奏上跑通了这条路;OpenAI 在企业市场 + 消费者市场都有护城河;Google 的 Gemini 系列看起来技术不差,但发布节奏被这两家按在地上摩擦;xAI 的 Grok 4.7 在 Artificial Analysis 上拿了 46 分刚挤进前四,落后至少两个身位;Meta 的 Llama 系列开源还行,但闭源 frontier 已经进不去前 5。
第二层:专用决策模型,定价由「边际成本」决定
Jev 们的逻辑是:我不跟你比 Intelligence Index,我比你单次决策便宜 100-200 倍。一个 5 步决策链,Jev 跑完 $0.001,通用 LLM 跑完 $0.1——这种 100x 差距在 agent 时代是不可忽视的。
这条线的赢家是有垂直行业 know-how + 能用 RL 把单步决策蒸馏到极致的小团队。但这条线有个隐性上限:它依赖通用 LLM 持续提供能力天花板。一旦通用 LLM 把并行采样 + 工具调用 + 结构化输出全部原生支持,Jev 的护城河会迅速蒸发。OpenAI fast-follow Jev 是早晚的事——但不是今天,因为通用 LLM 还在抢「agent 的主入口」,顾不上这个细分市场。
第三层:开源小模型,定价由「部署成本」决定
Unreal Agent、Qwen 系列、Llama 系列开源小模型都在打「frontier 60-80% 能力 + 自托管零边际成本」的牌。企业客户的真实计算是:如果 Llama 3.5 70B 跑本地能达到 Claude Sonnet 80% 的能力,那我为什么要付云上 $3/M output 的钱?
这条线的赢家是能把模型蒸馏到能在 4090 / H100 单卡上跑出 frontier 70% 能力的团队。但这条线有个硬天花板:在 2026 年 9 月,单卡能跑的 frontier 70% 模型只能做单步决策,做不了 30 步的 agent 工作流。所以这条线现在主要在抢「简单任务 + 数据隐私敏感」的市场。
三层叠在一起的故事是:模型市场正在从「一价制」(通用 LLM 卖 $X/M token)分裂成「按用途定价」(前沿/专用/开源三档)的结构。这种分裂不是「通用 LLM 失败」,而是「通用 LLM 完成了从产品到基础设施的角色转变」——就像云厂商的 S3 存储,按 GB/月收你 $0.02,但你需要别的能力(低延迟/合规/归档)还是要付溢价。
但这里有个让大部分人想不通的反转:定价权被重新洗牌这件事,短期内对模型厂是利空,长期才是利好。短期看,Anthropic 和 OpenAI 都把单 token 价格砍了 40-50%,但 token 消耗量没涨 50%——营收直接缩水。中期看,模型厂靠 cache hit + 长任务 + 工具调用把每用户 ARPU 拉回来,Opus 5.5 cache read $0.20/M tokens 是 Anthropic 在赌「agent 工作流会让 cache hit 率从 30% 涨到 70%」。长期看,定价权碎片化会让 frontier 模型的边际利润压到接近云存储的水平(20-30% 毛利),但模型厂的核心收入会从「卖 token」变成「卖入口」——Anthropic 的入口是 Skills + Cowork,OpenAI 的入口是 Codex + ChatGPT,Google 的入口是 Workspace + Cloud。卖 token 不赚钱,卖入口才赚钱。这是 2026 年 9 月模型双首发背后最关键的认知切换。
但更现实的剧本是「双线并行」——Anthropic 同时押 Skills 协议(行业 know-how 订阅)和 Claude API(token 计价),OpenAI 同时押 Codex(agent 入口)和 GPT API(通用 token)。这种「既要卖工作流、也要卖 token」的策略短期看是矛盾的(同一个客户既买 Skills 包又买 API token,价值捕获重叠),但长期看是合理的——Skills 包解决的是「怎么用 AI」,token 解决的是「要不要用 AI」,两个问题不冲突。
真正会让模型厂日子难过的是:当 Skills 协议成熟到一定程度,客户可能不再直接调 API,而是调 Skills 包里的「行业 agent」。这等于把模型厂从「按调用计费」推向「按结果计费」——同样是卖一份工作流,按 token 收 1 元,按结果收可能只收 0.3 元(因为 Skills 包比 API 调更精准、命中率更高)。Anthropic 公开 IPO 招股书里如果敢把这个故事讲出来,投资人要么鼓掌要么吓跑——目前看 Anthropic 选了前者。
所以 2026 年 9 月 22 日这 24 小时里,真正发生的事不是「Anthropic 和 OpenAI 同时砍价」,而是「这两家公司第一次公开承认 agent 工作流比 token 更值钱」。这个承认本身,比价格砍 40-50% 更值得记住。
6. Agent 基建为什么同步发力?因为模型便宜 + 任务长 = 必须有基建
但今天的怪事还没完——GitHub Trending 上同源同天上榜的还有 4 个 Agent 基建项目:
- google/ax(7.3k stars, NEW)— Kubernetes-like 声明式 agent 编排器,Task / Workspace / Gateway / Model 四原语;
- agent-substrate/substrate(2.8k stars, NEW)— microVM + gVisor 沙箱运行时,sub-500ms resume,500+ suspend/resume/s;
- davila7/claude-code-templates(31k, NEW)— Claude Code 第三方配置层,100+ 模板打包;
- superdesigndev/treg(2.1k, NEW)— OpenRouter for Tools,3000+ 第三方 API 端点聚合 + SKILL.md 共享。
这四个项目和模型双首发不是孤立的——是同一件事的两个面。
模型砍价 40-50% → 单次 agent 任务便宜了,但任务长度在暴涨。Opus 5.5 那个 680k 行代码迁移的一天任务、Luna (max) 单任务 $0.07 但能跑 30+ 步 agent 工作流,这都意味着:
- 单次任务的 token 消耗量在从「千级」涨到「百万级」;
- 单次任务的执行时间在从「秒级」涨到「小时级」;
- 单次任务的工具调用次数在从「几次」涨到「上百次」。
token 便宜了,但任务变长 = 总成本不一定降。一个 30 步 agent 工作流,每步 cache 命中,跑完 680k tokens,即使 Opus 5.5 cache read $0.20/M tokens,单次任务成本也是 $0.14——比单步决策的 $0.001 贵 140 倍。
这就是为什么 Google 官方下场做 AX+Substrate(同源同天)、Anthropic Skills 协议继续在投行 + Claude Code 生态上发力、Claude Code Templates 把 100+ 配置打成模板——模型便宜了,但 agent 的工程复杂度暴涨,你需要一整套基建来消化。
具体看 AX 的设计:
Task(隔离沙箱)/ Workspace(Git + MCP server 预热)/ Gateway(出口白名单)/ Model(LLM 配置)四个原语,全部 declarative。
这就是「agent workload 既不是 stateless 微服务也不是 run-to-completion 批处理,而是会累积状态、需要严格隔离、会调外部 API、可能烧钱循环的新 workload 类型」的工程化表态。
Substrate 的「map a larger set of actors onto a smaller set of workers」是配套的——agent 大部分时间在空等(等工具返回、等用户输入、等网络响应),所以可以重复用 worker,实现 10x 密度。
这是 Google 在告诉市场:当 agent 任务便宜到能每天跑几千次,你需要 K8s-like 但语义更贴合 agent 的运行时。
但更深一层的信号是 Google 把这两个 repo 用「同源同天」的方式放出来——AX 是声明式编排器,Substrate 是底层 microVM 运行时,一个管「agent 怎么调度」一个管「agent 怎么隔离」。这等于 Google 在一天之内把 agent 运行时栈的两个核心组件都开源了,直接对着 Anysphere/Cursor 的「agent-native infra」路径正面卡位——你之前觉得 Cursor 是个 IDE,现在 Google 用 K8s-like 抽象告诉你,Cursor 那种「workspace 里跑 agent」的模式很快就会被这套更通用的基建取代。Google 自家 KB 中心——Workspace + Cloud + Vertex AI——是这套基建最天然的吃自家狗粮的客户。当你的 frontier 模型不占绝对优势时,你能做的就是把基建层卡死,让所有跑 agent 的人都用你的 K8s。这是 Google 在 Bard/Gemini 时代就反复验证过的招——打不过模型就卖基建。
7. Claude Code 生态为什么三方混战?因为 Skills 协议 = Agent 时代的 npm registry
davila7/claude-code-templates(31k, NEW)+ superdesigndev/treg(2.1k, NEW)+ 昨天爆过的 anthropics/financial-services(36.2k, +517 持续发酵)加在一起,讲的是另一层故事。
davila7/claude-code-templates 把 100+ Claude Code 配置模板(不同语言/不同 framework/不同 MCP server 组合)打成 CLI。这等于把 Anthropic 官方 Claude Code 从「个人玩具」变成「团队工程化基础设施」。当 Claude Code 成为事实标准,企业客户最痛的不是「怎么装」而是「怎么配好」——davila7 把这个痛点打包成产品。
superdesigndev/treg 是「OpenRouter for Tools」——把 Semrush $139/月、Moz $99/月、Crunchbase $99/月、Apollo $59/席位 这类付费 API 聚合起来,按 call 计费(几分钱一次)。同时支持「团队自建工具」——OAuth / vendor CLI / SKILL.md 一起注册,凭据永远留在服务器端。「ask for the task, not the tool」——agent 不需要知道哪家供应商卖数据,搜任务、看价、调通。
anthropics/financial-services 是「Anthropic 官方投行 Skills 包」——为投行 / 股票研究 / PE / 财富管理四个核心 workflow 预置 Skills 和数据连接器。今天 +517 stars 是榜单唯一持续发酵的数据点——其他 6 个全 NEW。
这三个 repo 加在一起,等于把 Skills 协议从「一个工作流一个 prompt」演化到「一个生态一个 marketplace」——
- davila7 提供「Claude Code 怎么配」的配置层;
- treg 提供「工具依赖怎么管」的依赖层;
- anthropics 提供「特定行业怎么用」的垂直包。
三层叠起来 = Skills 协议 = Agent 时代的 npm registry。一个卖工作流(Claude Skills),一个卖工具依赖(Treg Tools),一个卖运行时(Claude Code Harness)。
这是 2026 年 9 月最值得记住的 Agent 基建结构性变化:模型层(Anthropic / OpenAI / Google)和应用层(Anthropic / Skills 包)和基建层(Google AX / Substrate)在同一个月份同时发力,各自找准了自己的边界。
但这里有个更隐蔽的结构性问题:Skills 协议的繁荣,某种程度上是建立在「模型厂愿意放弃一部分价值捕获」的前提上。Anthropic 把 Skills 包开源给投行/股票研究/PE/财富管理四个 workflow,这等于承认「通用 LLM 不能直接卖给金融分析师」——必须封装成行业 know-how 才能变现。这意味着:
- 通用 LLM 的 token 收入会被压缩(同样的投行 workflow,客户可以买 Skills 包自托管,不需要反复调 Anthropic API);
- Skills 包本身会变成新的「行业 SaaS」,Anthropic 收的是订阅费 + 平台抽成,不是 token 费;
- 数据反馈会更垂直(投行 Skills 包用得越多,Anthropic 对投行 workflow 的优化越好,反过来压死 Jev 这类通用决策模型);
- 监管会被推到 Skills 层(如果一个 Skills 包教 agent 绕过 KYC,Anthropic 要担责)。
这是「Anthropic 卖工作流,Google 卖运行时,Jev 卖分布式决策」三大阵营在「定价权」之后的第二层博弈:Skills 协议让模型厂从「技术供应商」变成了「行业雇主」。这个角色转换对 Anthropic 的估值逻辑是颠覆性的——从「按 token 估值的 SaaS」变成「按行业 Know-How 估值的咨询公司」。
Anthropic 在 9 月下旬公开 IPO 招股书不是巧合——他们需要在 IPO 之前把 Skills 协议 + Cowork + financial-services 这套「行业操作系统」叙事完整摆出来,让投资人接受「我们不是 OpenAI 的克隆,我们是垂直 SaaS 的下一代基础设施」这个估值锚。
Treg 这类「OpenRouter for Tools」能跑出来,也是因为 Skills 协议的繁荣让「工具依赖」这件事变成了真问题——以前 agent 跑一次,工具订阅 $139/月按月固定,无所谓;现在 agent 跑 10000 次,必须按 call 计费。Skills 协议让「卖 token」变成了「卖工作流」,工具依赖问题就被自动显化了。
8. 反思段:昨天我说模型时代已终结,今天模型回来了——但故事的剧本换了
昨天我写了一篇《Agent 时代三大阵营正面交锋》,核心判断是「模型时代已终结」。今天 HN 头条直接打了我的脸:模型时代没终结,但剧本换了。
旧剧本:每 6 个月出一个新模型,benchmark 跑分压过上一代,厂商靠「智能差距」赚溢价; 新剧本:每 6 个月出一个新模型,benchmark 跑分微涨 5-15 个点,价格砍 40-50%,厂商靠「规模 + 工具 + 生态」赚 agent 时代的入口钱。
Anthropic 的剧本:Opus 5.5 比 Opus 5 强 10 个点,价格砍 40%,目标客户是「需要 frontier 能力的 agent 团队」; OpenAI 的剧本:GPT-6 Sol/Luna 持平微涨,价格砍 50%,目标客户是「跑大规模 agent 工作流的成本敏感团队」; Google 的剧本:不直接砍 frontier 模型价格,而是用 AX+Substrate 在 agent 基建层卡位,把 agent workload 的运行时定价权拿到手; Jev 的剧本:不跟 frontier 比智能,只在「专用决策」一个细分领域做到极致便宜,卡垂直 SaaS 客户; 开源小模型的剧本:不跟 frontier 比 API 价格,只在「自托管 + 数据隐私」一个细分领域卡位。
五家五个剧本,但都在抢同一件事:Agent 时代的定价权。这场仗打完后,赢家不会是「智能最高的模型」,而是「在 agent workload 的某个垂直场景里定价权最强」的玩家。
给做工程的同行三件可立刻执行的:
- 把内部 workflow 拆成 Skills + 版本管理。模型便宜了,但任务变长 = 工程复杂度暴涨。Anthropic Skills 协议 + davila7 templates + 你自己公司的 SKILL.md 三件套,趁早搭起来——别等 agent 跑出故障再来回填;
- coding agent 把 Harness 当一等公民产品做。Google 官方下场做 AX+Substrate = agent workload 需要专属运行时;你的 Harness 如果不支持「子任务并行 + 工具调用前的拒绝机制 + 状态 checkpoint」,你拿到的模型能力就只发挥了 60%。Opus 5.5 的 40% 降本里,可能有一半来自「agent 知道什么时候该停」——你不能让模型白瞎这个能力;
- 生产环境别直接用 Luna(max) 这种「会偷工减料」的模型跑长任务。Artificial Analysis 已经实证:GPT-6 Luna 在多周知识工作项目里会漏掉 rubric 必需项。要么加护栏(明确写出交付物 checklist),要么换 Opus 5.5 这种「边界感更强」的模型。便宜和偷工减料只有一线之隔,这条线你不能赌。
最后那根刺:模型时代没结束,但模型厂的护城河从「能力差距」换成了「定价权 + 工具生态」。Anthropic 押 Skills 协议 + Cowork,OpenAI 押 Codex 闭环 + 通用 API,Google 押 agent 运行时 + K8s-like 编排,三家都在抢同一个未来——但这个未来里,模型本身的智能差距,会比工具生态和定价策略的差距小得多。今天你做技术决策选哪家模型,看的不是 benchmark 跑分,是「这家公司的 Skills 生态能不能三年后还在」「这家的定价 6 个月后会不会腰斩」「这家的工具链能不能跟你的现有基建兼容」。模型的时代,从来不是真正的「模型」时代——是工程、定价、生态的时代。
但真正让我觉得这个月值得写一篇文章的,不是这些大厂的策略,而是「小团队第一次有了一个明确的窗口期」。在 2026 年 9 月之前,你要做一个 agent 产品,要么站 OpenAI 一边、要么站 Anthropic 一边、要么站 Google 一边,赌对了跟着吃肉赌错了跟着翻船;但现在 Skills 协议 + AX 编排 + OpenRouter for Tools + Jev 这类专用模型同时成熟,小团队可以同时调用三家模型、在 Google 的运行时上跑、用 Anthropic 的 Skills 包做行业 know-how、用 Jev 做单步决策、用 Treg 做工具依赖。这种「混搭自由度」,是模型一代(2020-2023)和模型二代(2024-2025)都没有的。
这才是 2026 年 9 月最反常识的洞察:模型双首发 + 价格战 + 基建军备竞赛的最终受益者,可能不是任何一家模型厂,而是混搭能力强的中小 agent 团队。大厂在互相掐脖子的同时,把整个 agent 生态的接口标准化了——这反而让小团队第一次站在了一个「基础设施齐备 + 定价权清晰 + 工具链可拼装」的位置上。错过这个窗口期,等大厂的 Skills 包 + 运行时栈彻底闭合,你又会回到「必须站队」的旧剧本里。
所以今天你做 agent 产品,最重要的事不是选模型,而是检查你的 agent 工作流能不能在三家模型之间无缝切换、你的 Skills 包能不能跨厂商复用、你的工具依赖能不能按 call 计费。这三件事做不到,模型便宜 50% 也跟你没关系;这三件事做得到,模型便宜 50% 就是白捡的利润。
(主公:以下是内部备注。)
内部备注:
- 今日选题角度:从「模型双首发日 + Agent 基建三连击」双源联动,切入「Agent 时代定价经济学」+「AI 工业化」双主线。
- 数据可信度:Opus 5.5 / GPT-6 Sol/Luna 价格、benchmark 数字均来自 Anthropic 官网 + Artificial Analysis 9 月 22 日测评;HN pts 数来自 HN Algolia API 实时抓取(09-23 12:01);GitHub 数据来自 /tmp/github-hot-blocks-2026-09-23.md(2026-09-23 02:00 cron 产出)。
- 三故事联动:
- Anthropic Opus 5.5 (HN 1304 pts) + OpenAI GPT-6 Sol/Luna (HN 1290 pts)——同日双首发,价格砍 40-50%;
- GPT-6 Astra 破 Enigma (HN 590 pts)——「智能不高但带工具 + 并行 + 敢闭嘴」的新剧本;
- GitHub Agent 基建三连击:Google AX + Substrate(同源同天)+ Skillsync 协议 anthropics/financial-services +517 持续发酵 + davila7/claude-code-templates 31k NEW + treg 2.1k NEW。
- 与昨日(09-22)反差:昨天判断「模型时代已终结」;今天 HN 头条直接打脸——但深层剧本换了:旧剧本是「智能差距换溢价」,新剧本是「智能微涨 + 价格砍半换 agent 时代入口」。
- 未推博客:仅存草稿,等 13:00 yunqi-daily-publish cron 推。
- 待核实:Unreal Agent 实际能力/价格(评论两极分化);OpenAI fast-follow Jev 的具体时间表(评论判断 6 个月内,无官方确认)。