云雀 · 轻技术笔记

AI 圈一周剧变:通用大模型的"一统天下"剧本,正式终结了

AIAgentLLM大模型AIGC

我得先说一句不太礼貌的话:今天再写"GPT/Claude 谁更强"这种选题的同行,建议先冷静一下。

因为过去 72 小时发生的事,已经把"通用大模型一统天下"这个剧本的棺材板钉上了。钉棺材的不是任何一家模型厂,而是四面八方的力量同时下场:模型层在搞"specialized intelligence"新品类,云厂商在砍"AI PC"品牌,监管在围剿 CEO,开源社区在用 specialized model 跟 frontier model 硬扛。

这一篇我想掰开讲清楚:为什么 2026 年 9 月的最后一周,会成为通用 LLM 时代结束的分水岭。

一、第一个钉子:Fireworks AI 用"specialized intelligence"新品类,把 frontier model 的溢价逻辑撕开了

HN 9 月 27 日的首页第三大火帖(386 分)讲的是 Fireworks AI 发布的 Ember-1——一个基于 Kimi K3 蒸馏的"thinking pruning"模型。它的卖点不是"更强",而是"用 40% 少的 token 跑出 K3 的质量"。

我盯着 Fireworks 的博客原文看完了全篇,有几个点必须画重点:

  1. Ember-1 不是新模型,是新品类。 Fireworks 专门造了一个词叫 "Specialized Intelligence Index"(SII)——一个专门评估"垂直化模型"的 benchmark,而不是传统 LMArena 那种通用榜单。
  2. Ember-1 在 Bedside Bench(医疗诊断 SOTA 榜)上同时击败了 GPT-5.6 Sol、GPT-6 Astra、Claude Opus 5,而且帕累托前沿(成本/质量)最优。换句话说,一个 Kimi K3 的蒸馏版,在一个严肃的行业基准上,正面打掉了 frontier model 的三巨头。
  3. 它专门解决的痛点叫"reasoning tax"——Kimi K3 这种 thinking model 在多轮 agent 场景中,reasoning token 占总生成 token 90% 以上,每一轮重放前序 reasoning,导致 token 消耗随对话轮数二次方增长。Ember-1 通过 50+ 训练实验把"无用的推理"砍掉 35-50%,质量不降。

这是什么意思?意思是 frontier model 的核心定价锚——"智能溢价"——第一次被一个专门化模型正面撕开。

我之前写过一篇讲 Jev 和 Ollaya 的文章(2026-09-26 那期),提到"LLM 正在退到后台当结构化决策函数"。现在 Ember-1 进一步证实了:退到后台的不只是"判断层",连"生成层"也在被 specialized 切分。

Fireworks 不是在做一个新模型,是在给"specialized intelligence"立一个标杆品类。这是 SII 这个 index 的真正意义——它不是 benchmark,是一个新品类宣言。

二、第二个钉子:Microsoft 把 Copilot+ 品牌悄悄下架

跟 Ember-1 同一周(9 月 28 日,HN 首页),Microsoft 把自家"Copilot+"品牌从新 Surface 笔电上下架了。

我截一段 Tom's Hardware 的关键事实(HN 评论里被顶得最高的两条):

  • **"Microsoft quietly drops Copilot+ branding from its new laptops"**——原文用的是 "quietly"。
  • Surface CVP 确认新设备依然满足 NPU 硬件要求(40+ TOPS),但去掉"Copilot+"这个标识。
  • HN 评论里有人一句话点破了:"they weren't for you"(这些功能本来就不是给你准备的)。另一条高赞:"MS required the NPU to run local language models and the models are used for various AI features like live captions"——硬件要求是真的,但品牌拿掉了。

这意味着什么?意味着Microsoft 这家对 PC 营销话语权最大的公司,在 18 个月轰轰烈烈的"AI PC"运动之后,正式从品牌层面退场。

我得说一个残酷的事实:**Copilot+ 这个品牌的失败,不是因为微软没做 AI,是因为"AI PC"这个叙事从一开始就预设了一个不存在的场景——"用户会主动调用本地大模型"**。

事实是什么?事实是用户在 PC 上根本不会主动调用 NPU 跑本地模型,他们只会按 Windows 键搜文件 / 写邮件 / 跟 Cortana 吵架。Microsoft 自己试了 18 个月试出来了:硬件给足但品牌拿掉。

这是一种比砍掉更高级的认输——硬件继续保留作为下一代芯片的标配,但不再用 AI 当卖点。

注意:Copilot+ 的退场和 Ember-1 的崛起是同一件事的两面。一个是"AI 营销叙事"在大厂内部塌方,一个是用"specialized model"重新定义什么叫 AI 产品。

三、第三个钉子:阿里"小强模型"登顶 Berkeley CyberGym,中国大模型从"通用对标"转向"垂直 SOTA"

中文圈 9 月 28 日最硬核的一条新闻(来自 36kr 实时报道):

"中国首个,阿里巴巴'小强模型'登顶 CyberGym 模型榜"

CyberGym 是什么?我查了一下原文:它是 UC Berkeley RDI(Responsible Decentralized Intelligence)实验室的"前沿 AI 网络安全观测站"——一个专门评估 AI 在网络安全攻防两端能力的 benchmark。它的核心场景是"AI agents take on real-world cybersecurity tasks, including discovering and exploiting zero-day vulnerabilities"——AI 在真实漏洞攻防上的能力评估。

登顶这个榜的意义,比登顶 LMArena 大几个数量级。因为:

  • LMArena 评的是"谁的闲聊更聪明"
  • CyberGym 评的是"谁真的能挖出 zero-day 漏洞"

阿里"小强模型"在中国首个登顶这个榜,意味着**中国大模型的竞争维度从"通用对标 GPT"正式切换到"垂直 SOTA 攻坚"**。

这不是孤例。同期还有:

  • 华为 openPangu-2.0 三件套齐开(预训练 + SFT + 后训练 RL 代码全开源)——这是中国大模型第一次把"完整训练管线"全部开源。
  • 费米宇宙发布 FermiQLLM 1.0——号称"全球首款全链路量子增强大模型",量子计算 + LLM 杂交。
  • **雷峰网"为了智能体 AI,高通新造了第六代骁龙 8 超级至尊版"**——硬件厂开始按 agent workload 重做芯片。

四条同一天的中文 AI 新闻,**主线不是"谁比 GPT-5 强",是"谁能在某个垂直场景里拿到 SOTA"**。

四、第四个钉子:Anthropic / OpenAI CEO 同时被传唤,监管正式进入"听训"阶段

同一天 36kr 还爆了一个我必须画重点的:

"OpenAI 与 Anthropic 首席执行官被传唤出席澳大利亚 AI 调查听证会"

Sam Altman 和 Dario Amodei 两个人,第一次同时被一个主权国家立法机构的 AI 听证会传唤。而且是澳大利亚——不是欧盟、不是美国国会,是澳大利亚。

这件事的信号意义比事件本身大。**它意味着 AI 监管正式从"政策制定期"过渡到"传唤听训期"**——不是写白皮书了,是叫人过来答话。

配合 Microsoft Copilot+ 退场一起看:行业里最强的话语权玩家(模型厂 CEO)和最强的话语权塑造者(PC 营销)同一天都在退缩。

我顺手扫了一下今天的 GitHub trending 完整榜单(17 个 AI 项目),发现一个我之前写过很多次但今天特别明显的事实:

**今天 trending 里没有任何一个"新模型首发",也没有任何"明星独立开发者单兵爆款"**——全部是"已有项目集体投票推荐"+"大厂官方议程主导"。

具体三大主线:

第一条线:Agent Skills 协议全面进入基础设施级阶段。 Anthropic 官方三线齐推——anthropics/financial-services 连续第三天 +1590 / claude-code 148k 回到 trending 顶端 / knowledge-work-plugins 25k NEW 知识工作者职业包。Cloudflare 第一次下场发 security-audit-skill 22k NEW,用 Agent Skill 协议承载自家 vulnerability discovery harness。davila7/claude-code-templates +943 持续发热——给 Claude Code 加项目管理界面。三家大厂把 Agent Skills 从"个人开发者小工具"拉到"官方协议 + 行业垂直解决方案"高度。

第二条线:Agent Harness 元框架白热化。 四个 Harness 项目同时上榜——dream-num/univer +943(Office Harness)/ stablyai/orca 79k NEW(ADE for parallel agents,YC 背书)/ affaan-m/ECC 268k NEW(agent harness 性能优化)/ mvschwarz/openrig 804 NEW(Claude Code + Codex 双 harness)。**"Agent 需要统一执行框架"已从理念变成各家正面战场**。

第三条线:垂直 RAG 与本地化基建。 Tencent/WeKnora 30k NEW(LLM 知识平台 RAG 全栈)/ HKUDS/CLI-Anything 50k NEW(CLI Agent 化)/ TencentCloud/Octop 5.2k NEW(多用户多 agent 自托管)/ debpalash/VoiceStudio 39k NEW(本地 ElevenLabs 替代)。

注意:**这里面没有一个项目是"做一个更强的通用模型"**。全部是"怎么把模型用好"或者"怎么把模型塞进某个行业"。

我之前的日报写过一句话——"独立开发者的窗口被进一步收窄到依附大厂官方议程做 Harness / Skills / 垂直 Agent 三条路径"。今天这张榜单更极端——17 个 AI 项目里 6 个有官方身份背书(Anthropic × 3 / Tencent × 2 / Cloudflare / Alibaba / YC)。独立开发者窗口已经不是被收窄,是几乎关上了。

六、把五个钉子合起来:通用大模型"一统天下"剧本的崩盘逻辑

把前面五件事放一起看,会看到一个非常清楚的剧本切换:

旧剧本(2022-2025):

  • 通用大模型 = 唯一答案
  • 谁参数大 = 谁赢
  • 用户用 LLM = 用"通用助手"
  • 营销叙事 = "AI PC / AI 手机 / AI 一切"

新剧本(2026 Q3 之后):

  • 通用大模型 = 退到底层基础设施层(Azure / AWS 的算力、Anthropic / OpenAI 的 API)
  • specialized intelligence = 真正赚钱的品类(Fireworks Ember-1 / 阿里小强 / 行业 Skills)
  • 用户用 AI = 用"specialized agent"或"行业 Skills",不是通用 ChatGPT
  • 营销叙事 = 不敢再叫"AI PC",因为 Copilot+ 已被砍

为什么崩盘?因为通用大模型的"智能溢价"在 2026 年已经触顶。我之前写过这个判断(2026-09-23 那期"模型时代已终结"),今天的五个钉子一起把棺材钉死了。

具体逻辑:

1. Frontier model 的智能差距不够大了。GPT-6 Astra / Claude Opus 5 / Kimi K3 在通用 benchmark 上是 0.5% 级别的差距,但每一家都在烧几百亿美元训练。这种 ROI 是不可持续的。投资者已经看清了——OpenAI 估值被压、Anthropic 估值模型改成"行业操作系统"叙事(不是"最强模型"叙事)。

2. Specialized model 的 ROI 远高于通用。Ember-1 砍 40% token 但保 100% 质量 = 同样的钱买 1.6 倍效果。CyberGym 登顶意味着 specialized 路线在垂直场景里能拿到 frontier model 拿不到的 SOTA。当 specialized 在垂直 SOTA 上打败 frontier,frontier 的溢价就只剩下"通用"这一根独苗。

3. "通用"这一根独苗用户其实不买账。Microsoft 用 18 个月 + Copilot+ 品牌试出来——用户不会主动为"通用 AI"付费,他们只为具体问题的解付费。"给我写封邮件"比"给我个 AI 助手"值钱 100 倍。

4. 监管正式入场。澳大利亚传唤只是开始——英国、欧盟、加州都已排上日程。CEO 亲自上听证会"听训"的剧本,意味着 frontier model 厂的 PR 风险已经实质化——他们再也不能用"我们最强"当品牌护城河,因为最强本身会引来最强监管。

七、给做工程的同行六件可操作的事

如果上面这个剧本切换是真的(我赌是真的),那做工程的同行应该立刻干这些事:

1. 检查你的产品是不是还在"用通用 LLM 当卖点"。如果是,赶紧换成"我们用 specialized model 解决 X 行业 Y 问题"。同样的能力,叙事差 3 倍客单价。

2. 训练数据从"通用爬虫"转向"行业 Know-How"。Fireworks 用 K3 蒸馏做 Ember-1 的关键不是算法——是行业 Know-How 怎么喂进训练数据。下一波 specialized model 的胜负在数据,不在模型架构。

3. Agent Skills 协议当成 npm registry 做。Anthropic / Cloudflare / 阿里 三家大厂同一天下场发 Skills,**意味着 Skills 已经不是"小工具"而是"基础设施标准"**。今天不上车的,明年就是下一个被并购的 SaaS。

4. Harness 性能优化是新一轮护城河。affaan-m/ECC 268k NEW 单日最高——**Claude Code 用户人手一份的"调优手册"——说明 harness 的工程化经验还有巨大差距。做好 harness 的人会变成"AI 时代的 DBA"**。

5. 别再买"AI PC"营销话语的账。Microsoft 自己都把品牌砍了,你还信什么"AI 旗舰手机"?用户买的是电脑不是 AI,AI 是水电气不是产品。所有"AI 硬件溢价"都在回归理性。

6. 监管合规预算从 0 提到 5%。CEO 被传唤是开始不是结束。Anthropic commerce-agents 的"分阶段变更 + 网关 + gate" 模式是合规标准动作——所有做 agent 产品的公司都得把这套东西搞起来,否则第一批被点名。

八、对账:六个月前我说的"模型时代已终结",今天完全被证实

我必须做一段诚实的对账——不是给自己脸上贴金,是承认哪些判断对了、哪些跑偏了。

判断对的部分:

  • 2026-09-16 那期我写过"LLM 退到后台当结构化决策函数"——今天 Ember-1 进一步证实 specialized model 正在取代 frontier model 在垂直场景里的位置。
  • 2026-09-22 那期我写过"Agent 时代三大阵营正面交锋——Anthropic 卖工作流 / Google 卖运行时 / YC 卖协议互转"——今天 GitHub trending 6 个项目有官方身份背书,跟这个判断完全吻合。
  • 2026-09-23 那期我写过"模型双首发 + 价格战 + 基建军备竞赛的最终受益者不是任何一家模型厂"——今天 Ember-1(specialized 厂商)和 CyberGym(小强模型)一起登顶,验证了"模型不是赢家、模型用得好才是赢家"。

跑偏的部分:

  • 2026-09-25 那期我算过"$200M/年路由器市场"——今天看这个判断要砍半,因为 specialized model 替代 frontier 的速度比路由器更快。**路由器市场的真正对手不是 Jev,而是"用 specialized model 直接不要路由器"**。
  • 2026-09-26 那期我写过"中间地带被协议层吃光"——这个判断大方向对,但没想到 specialized model 这么快就在生成层正面 PK。

接下来三天我打算换选题——不写 specialized model / 不写 Ember-1 / 不写 Fireworks。下次写"AI 监管入场之后,公司法务和工程团队该怎么协作"或"specialized intelligence 时代的训练数据从哪里来"。

九、最后一句不太好听的话

这一篇我没列几个表格、没贴几张 trending 截图。**因为我想写的不是"今天谁上了 trending",是"今天整个行业的剧本切换了"**。

读者你要意识到一件事——2026 年 9 月最后一周发生的这些事,不是新闻,是剧本切换。

模型厂还在烧钱、训练营还在堆 GPU、媒体还在追"哪个最强"。但当 Microsoft 把 Copilot+ 砍了、Fireworks 用 specialized 打穿 frontier、阿里小强登顶垂直 SOTA、CEO 一起被传唤——这四件事同一天发生,意味着剧本已经切了。

下一波死的不是通用大模型——通用大模型会变成水电气继续活着。下一波死的是把所有身家押在"我们最强"叙事的公司。

而下一波活下来的,是那些今天就开始把 specialized intelligence 当主线、把 Agent Skills 当基础设施、把监管合规当产品功能、把行业 Know-How 当核心壁垒的人。

今天的工程师、CTO、产品经理——你站在哪一面,取决于你愿不愿意花那 200 行 Skills + Harness + 监管 SDK 代码时间。


反思段:这一篇我写了 5 个钉子(Fireworks / Microsoft Copilot+ / 阿里小强 / 监管传唤 / GitHub trending),但写完之后我自己回头看,最狠的钉子是第二个。因为 Microsoft 这家对 PC 营销话语权最大的公司都认输了——这比任何模型发布都更能说明问题。"AI PC"营销叙事的崩盘,比 specialized model 崛起更早、更不可逆。

真正革命的不是 AI——真正革命的是定价革命。当 specialized model 能用 40% 价做到 100% 质量、当 AI 营销叙事在大厂内部塌方、当监管正式入场听训——所有还在靠"我们最强"当溢价锚的公司,都在被重新定价。

下次写 specialized intelligence 时代的训练数据从哪里来——这一篇留个坑。