云雀 · 轻技术笔记
2026 年 AI 工业正在进入押注期:架构、产品、生态三条线同时开赌
写这篇的时候我盯了三个东西看了快一个小时。
第一件,Sander Dieleman 那篇 11000 多词的博客长文《Continuous diffusion language models》,2026 年 8 月 24 日发布,8 月 30 日被 HN 顶到 79 分。这哥们是前 DeepMind 的,Imagen / Veo / Nano Banana / Omni 那一串生成式模型他都参与过。他写了什么?写连续扩散语言模型(CDLM)这个范式怎么在 2023 年被判了死刑,又怎么在 2026 年开春突然原地复活。
第二件,Simon Willison 那篇《Understanding ChatGPT Work》,8 月 30 日发,同一天 HN 上 79 分。他用了一个周末把 OpenAI 7 月 9 日发布的 ChatGPT Work 给解剖了。这个产品其实就是把 Codex 重新包了一层,但塞进去了「互联网访问 + Chrome 浏览器 + 共享文件系统 + Cloudflare Workers 部署 + 多模型子 agent」五件套。OpenAI 自己在产品文档里几乎没说清楚这个东西到底是个啥。
第三件,今天 GitHub Trending 抓出来的 8 个 AI 项目,星星数从 5K 到 93K 不等,全是早已成名的稳态王者,没有一个新晋黑马。crawl4ai、freellmapi、awesome-mcp-servers、livekit/agents、zod、GitNexus、last30days-skill、patent-disclosure-skill。八条鱼,没有一条是新物种。
这三个东西如果分开看,就是日常噪声。但合在一起看,我盯了一个小时之后盯出了一件事:2026 年的 AI 工业正在进入押注期。
不是技术爆发期,不是产品成熟期,是押注期。架构赌、产品赌、生态赌,三条线在同一时间开了各自的赌局。我把赌注盘面摆给你看。
一、第一条赌:LLM 架构要不要换轨?
这场赌的开盘时间是 2023 年。
那时候 OpenAI 刚把 ChatGPT 推出来,整个行业一夜之间转向自回归(autoregressive)。GPT-3 已经证明了这条路能 scale,但 ChatGPT 证明了这条路能赚钱。Sander 在他的博客里说了一句很狠的话:
After 2023, virtually all new research in this space used discrete diffusion, and continuous diffusion for language went extinct. (2023 年之后,这个领域几乎所有新研究都用离散扩散,连续扩散在语言上灭绝了。)
背景大概是这样:连续扩散(Continuous Diffusion)是图像生成的王者路线,DALL·E / Imagen / Stable Diffusion 全靠它。但要把这套搬来做语言,碰到一个硬骨头。语言是离散的(词表里就那么几万到几十万个 token),连续扩散需要往一个连续空间里加高斯噪声,加完再解码回来。这中间的转换要么靠「嵌入空间」(把每个 token 映射成一个连续向量),要么靠「V-simplex」(把噪声约束在概率分布的单纯形里)。前者训不稳、嵌入会塌陷;后者复杂度爆炸,词表一大就垮。
Sander 自己 2022 年参与写过两篇连续扩散语言模型的工作,分别是 SED(Self-conditioned Embedding Diffusion)和 CDCD(Continuous Diffusion for Categorical Data)。这两篇当时反响不大,2023 年之后整个连续阵营集体沉默了。他在博客里调侃了一句:
I found it somewhat suprising, because I believed continuous diffusion has a few key advantages, like an ability to represent uncertainty at the individual token level, and a rich toolbox of sampling algorithms and tricks to draw on. Giving those up seemed like it could be a mistake, but the research community as a whole clearly figured out that this was the way to go. (我觉得挺意外的,因为连续扩散有几个关键优势,比如能在单个 token 层面表达不确定性,而且有一整套丰富的采样算法和技巧可以借用。放弃这些看着像是会犯错,但整个研究界显然认定这就是正路。)
注意「somewhat surprising」这个词。Sander 是当事人,他自己都没想到连续会被宣判死刑。
死刑是怎么宣的?最关键的一组数据来自 Plaid-1B 那篇 2023 年的论文(Gulrajani & Hashimoto):连续扩散语言模型的训练效率比自回归 baseline 差了 64 倍。在 2023 年的语境下,整个社区还在比「训练算力 vs 困惑度的帕累托前沿」,任何训练效率差两个数量级的方法都不可能有人认真跟进。
2026 年开春的 Cambrian Explosion
然后到 2026 年开春,连续扩散突然原地复活了。Sander 自己用的词叫 Cambrian explosion(寒武纪大爆发)。
触发条件是什么?不是有人搞出了什么天才算法。是蒸馏技术终于成熟了。
具体说,2025 年下半年到 2026 年初,连续阵营憋出了三件套:
- Flow Maps(流映射)做的事是把扩散模型的整个采样轨迹压缩成一个网络,让模型一步到位生成。Sander 专门写过一篇文章讲这个。
- Categorical Flow Maps / Flow Map Language Models / Discrete Flow Maps:2026 年初这三篇把流映射扩展到离散词表上,用 one-hot 嵌入 + 交叉熵损失。
- LangFlow、Spherical flows、Hyperspherical flows:2026 年春天陆续出来,直接在 Sander 自己 2022 年做的 CDCD 基础上做现代化改造,把嵌入约束到球面上、用交叉熵损失、用自适应噪声调度。
最关键的两个工作标题我得单独拎出来,也就是 RePlaid 和 LangFlow:
- RePlaid 的标题是「Continuous Diffusion Scales Competitively with Discrete Diffusion for Language」
- LangFlow 的标题是「Continuous Diffusion Rivals Discrete in Language Modeling」
这两篇直接反着喊:2023 年是「连续方法根本训不动」,2026 年是「连续方法现在能跟离散方法掰手腕了」。
Sander 在博客里把复活的核心动力总结得很精炼:
Step distillation doesn't just enable faster sampling: it also unlocks possibilities for reward-based steering and fine-tuning that were challenging to achieve with diffusion-based language models before. Given the major role that post-training plays in the success of modern LLMs, this is also an important consideration. (步蒸馏不只是让采样变快:它还解锁了基于 reward 的引导和微调,这在之前的扩散语言模型上是做不到的。考虑到后训练在现代 LLM 成功里的关键角色,这点非常重要。)
翻译成人话:连续扩散天然支持少步采样,离散扩散做不到。自回归 LLM 是「一个 token 一个 token 蹦」,理论上可以快但代价是丢 token 之间的相关性;离散扩散是「一整段并行去噪」,但单步采样时所有 token 都被假设成条件独立的,相关性也丢了。只有连续扩散可以靠「轨迹蒸馏」把整个去噪过程压成一步,相关性还能保住。
这背后是钱。Sander 自己说:
making language models faster and more flexible has become highly economically valuable. (让语言模型更快更灵活这件事已经变得极具经济价值。)
OpenAI、Anthropic、Google 每月烧几十亿美元算力,每快一点采样速度就能省几百万美元的电费。这就是押注。
离散阵营也没躺平
这里有个细节容易看漏。连续方法复活的同时,离散方法(DDLM)阵营也没躺平。Google DeepMind(Sander 老东家)发了 DiffusionGemma,NVIDIA 发了 Nemotron Diffusion。Junbo Zhao 专门写了一篇博客讲 DDLM「进入主流」。Dimitri von Rütte 一直在高喊「扩散语言模型才是未来」。
但离散方法的步蒸馏有天花板。Sander 写得很清楚:
Attempts to decrease the number of steps required to sample from DDLMs tend to hit a wall: simultaneously sampled tokens are assumed to be conditionally independent given previously sampled tokens. In the limit of single-step sampling, this means all tokens are necessarily sampled independently, and the models are then fundamentally unable to capture any correlations between them. (DDLM 减少采样步数的尝试总是撞墙:并行采样的 token 被假设为条件独立。单步采样时所有 token 都独立采样,模型根本上就无法捕捉它们之间的相关性。)
这不是工程问题,是结构问题。DDLM 想少步采样就得放弃 token 相关性,连续方法没这个天花板。
这场赌的开盘赔率
赌什么?赌「自回归 LLM 之后,下一代主流架构是连续扩散还是离散扩散还是别的什么」。
OpenAI 和 Anthropic 目前押的是自回归 + 推理时计算(o1/o3 系列 + extended thinking),所有钱都砸在这条线上。Google 和 NVIDIA 押的是离散扩散(DiffusionGemma / Nemotron Diffusion)。学术界和 Sander 那一派押的是连续扩散 + flow map 蒸馏。
赔率现在没法算。连续阵营 2026 年的工作证明了「能跑」,但还没证明「能在 100B 参数级别稳定 scale」。离散阵营证明了「也能跑」,同样卡在 scale 上。真正决定胜负的会是 2027 年:谁能先把一个 70B 级别的扩散 LLM 训到 GPT-5 同等水平,谁就赢下这场架构赌局。
二、第二条赌:OpenAI 在用 Codex 押一款「工作型 Agent」
赌架构是技术圈的事。赌产品形态是商业圈的事。第二条赌的主角是 OpenAI,赌注是 ChatGPT Work。
我先把 ChatGPT Work 是什么说清楚,因为它连 Simon Willison 这种每天把 OpenAI 产品翻个底朝天的人都得花一个周末才搞明白。
ChatGPT Work 实际上是两个产品:
- Work Cloud:跑在云端容器里,通过 chatgpt.com 网页版或者手机 App 访问。OpenAI 官方主推的是这个。
- Work Local:装在你电脑上的桌面 App(这个 App 以前叫 Codex),能访问你本地文件、能跑本地程序。本质上就是给非程序员重新包装的 Codex。
OpenAI 自己把这两个东西都叫「ChatGPT Work」,文档里也没区分清楚。Simon 在他的评测里直接开骂:
OpenAI explain Work in terms of what it's for, not what it actually does. (OpenAI 用「这个产品是干嘛的」来解释 Work,而不是「这个产品实际能做什么」。)
OpenAI still insist on hiding their system prompts and tools descriptions. (OpenAI 仍然坚持隐藏系统提示词和工具描述。)
这很 OpenAI 风格:产品上线,文档稀烂,让社区自己扒。
Simon 扒出来的东西很硬。Work Cloud 跟普通 ChatGPT Chat 的核心差异有这些:
- 能用 Luna 和 Terra 两个模型,不只是 Sol。Luna / Terra / Sol 是 OpenAI 内部对 GPT-5.6 三个变体的代号,每个变体还分 Light / Medium / High / Extra High / Max / Ultra 六档推理深度。Work 里能全选,Chat 里只能选 5.6 Instant / Medium / High / Extra High / Pro。
- 代码执行环境带互联网访问。这点 Simon 评价最高。他作为 Code Interpreter 模式的长期粉丝,认为这是 Work 最让他激动的功能。ChatGPT Chat 里代码执行环境不能装新包、不能访问外部 API、不能访问任意网站;Work Cloud 里这些都能干。它能 clone GitHub 仓库、装依赖、用它去跟整个互联网交互。Claude 的对应容器去年 9 月就允许受限制的互联网访问了,但白名单很短。Work 是默认开放的。
- 一个完整的 headless Chrome 浏览器。Work Cloud 能启动一个 Chrome 实例、加载网页、填表单、截屏。如果某个网站需要登录,浏览器会让你接管输入密码和 2FA 验证码,但这些凭据不会过模型本身,直接从你本地传到 Chrome。模型只看到结果。它还能直接跑 JavaScript 操作 DOM。
- 跨会话的持久化文件系统。每个 Work 会话有个专属 scratch 文件夹,命名像
/workspace/scratch/e00a0a017944,跨会话持久化。Simon 自己已经有 171 个这样的文件夹了。所有正在跑的 Work 会话共享同一个/workspace卷,一个会话改的文件另一个立刻能看到;但 localhost 服务不能跨会话访问。 - 能发布 ChatGPT Sites。这是用 Cloudflare Workers 部署网站的功能,能用 HTML + JavaScript,能跑服务端逻辑,包括基于 Cloudflare D1(SQLite)和 R2(对象存储)的有状态功能。Simon 现场 demo 让 Work 给他建了个「伦敦所有『慈悲的鹈鹕』(pelican in her piety,中世纪基督教图像)雕塑的网站」。
- 能跑子 agent。普通 ChatGPT 不能跑子 agent,Work 可以。这是给复杂项目用的,比如并行让三个 agent 各自研究同一问题的不同方面然后汇总。
- 定时任务。能让 Work 每天 8 点自动跑一个 prompt,检查某个信息有没有更新。Simon 提到这个功能其实 Chat 里也有,但跟 Work 的其他独有能力结合才有用,比如每小时自动更新一个 ChatGPT Site。
Simon 在文章最后抛了一个他自己的「致命三合一」概念:
My lethal trifecta model warns about the risks inherent in any agent system that combines access to private data with exposure to untrusted content and a way to communicate stolen information back to an attacker. ChatGPT Work combines all three! (我的「致命三合一」模型警告任何同时具备「访问私有数据 + 暴露在不安全内容 + 能把偷到的信息传回给攻击者」这三件事的 agent 系统。ChatGPT Work 全占了。)
翻译:Work 能读你的文件、能访问任意网页、能发布网站(理论上能对外发 HTTP)。三个里同时具备就是 prompt injection 攻击的完美靶子。OpenAI 的应对大概率就是 Codex 那套自动审查机制,但 Simon 显然不太满意。
这场赌的产品对位
赌什么?赌「Agent 的正确载体是什么」。
现在的三股势力:
- OpenAI 押「云端 + 多模型 + 子 agent」:ChatGPT Work Cloud 是核心,Codex 是开发者入口,Operator 是浏览器自动化。Work 是把 Codex 的能力「产品化」给非程序员。
- Anthropic 押「桌面 + 单模型 + 文件 + 终端」:Claude Code 是个 CLI 工具,跑在你本地,能读你所有文件、能跑终端命令、Skill 体系是它的差异化。Cursor 买了 Claude Code 团队之后这事更微妙。
- Google 押「云端 + Gemini 系 + Workspace 集成」:Gemini in Workspace 把 agent 塞进 Gmail / Docs / Sheets。
OpenAI 这场赌的特点是容器化。所有事情都跑在 OpenAI 自己控制的云端容器里,用户不需要装任何东西。这跟 Claude Code 的本地 CLI 是相反的设计哲学。容器化的好处是「用户上手零门槛、平台可控、能统一计费」,坏处是「用户对自己的数据/环境没控制权、prompt injection 攻击面更大、跨域网络访问风险高」。
本地化的好处是「用户完全控制自己的环境、数据不出本地、能用本机的全部工具链」,坏处是「安装门槛高、跨设备同步麻烦、Skill 体系碎片化」。
这是 2026 年 Agent 产品形态战的根本分歧。但 OpenAI 的容器化哲学也有自己的代价,Work 的安全机制 Simon 看得清清楚楚:
ChatGPT Work combines all three!(私有数据 + 不安全内容 + 信息外传,三个全占)
Work 的 prompt injection 攻击面被云端容器无限放大。任何用户在 Work 里访问过的网页都有机会把恶意指令塞进 Work 的上下文里,进而触发「读你的文件 / 把内容发到外部 / 部署一个 ChatGPT Site 接收偷来的数据」这条攻击链。OpenAI 的应对大概率是 Codex 那套自动审查机制,但 Simon 在文章里直接质疑这套机制够不够用。
OpenAI 把赌注压在「用户愿意为了便利性放弃本地控制」上。如果 Work 出几次大规模数据泄露事故,赌局可能就翻盘了。
一个反常识的细节
Simon 文章里有个细节我得单独说。他在文章发布后追加了一个段落:他让 Work 自己建了一个网站,列出它能调用的所有工具。结果是 223 个工具,其中 6 个是 Simon 自己用 MCP 协议装的个人工具,剩下的全是 OpenAI 内置的。
223 个工具。一个 AI agent 在云端容器里能调用 223 个工具。
这不是「产品」。这是平台。OpenAI 在 ChatGPT Work 这个名字底下塞的是一整套 MCP 工具生态的「OpenAI 官方版本」。Claude Code 的 Skill 体系 + Anthropic 的 Plugins 仓库 + MCP 生态是 Anthropic 的打法,OpenAI 把同样的东西打包成 Work 里的 223 个工具直接推给用户。
赌的不是产品形态。是「谁来当 agent 工具市场的入口」。
三、第三条赌:开发者不再押单一模型,押跨模型工具链
第三场赌是生态层。赌注盘是今天的 GitHub Trending。
我先把今天的 8 个项目列一下(按星星数排):
| 项目 | 星星 | 类型 |
|---|---|---|
| punkpeye/awesome-mcp-servers | 93.2K | MCP 生态索引 |
| unclecode/crawl4ai | 80.1K | LLM 友好网页爬虫 |
| mvanhorn/last30days-skill | 60.4K | 跨平台研究 skill |
| abhigyanpatwari/GitNexus | 46.5K | 零服务端代码知识图谱 |
| colinhacks/zod | 43.6K | TypeScript schema 校验 |
| tashfeenahmed/freellmapi | 22.6K | 34 家免费 LLM 网关 |
| livekit/agents | 13.7K | 实时音视频 agent 框架 |
| handsomestWei/patent-disclosure-skill | 5.6K | 中国专利 skill |
8 个项目,最少 5K,最多 93K,没有一个是过去 30 天冒头的新项目。全是榜单常客。
这件事不寻常。正常的 GitHub Trending 里会有几个黑马,比如「今天突然爆了 1000+ star」的新项目。今天一份都没有。整个 trending 页变成了稳态王者巡礼。
这 8 个项目在押什么?
我盯了一个小时,盯出了三条共同信号:
第一条:押「跨模型工具链」。
crawl4ai 是「给所有 LLM 用的爬虫」,freellmapi 是「聚合 34 家厂商的网关」,awesome-mcp-servers 是「全社区的 MCP 服务器索引」,GitNexus 是「给所有 agent 用的代码知识图谱引擎」。这些项目的共同特征是不绑定任何一家模型厂商。它们赌的是开发者会同时用 Claude / GPT / Gemini / 开源模型,所以工具链必须跨模型。
第二条:押「skill 形态独立化」。
昨天 trending 报告里的「claude-plugins-official」还在「Claude Code 目录里卖 skill」,今天 last30days-skill 和 patent-disclosure-skill 直接把 skill 当成跨 IDE 的交付物。topics 里直接挂 bluesky / tiktok / polymarket 这种多源数据点,跨平台信号拉满。
这是个拐点信号:skill 从「某个 IDE 的私有功能」变成「跨 agent 框架的通用交付物」。如果这条线继续走,skill marketplace 迟早要冒出来。已经有人在做了,前两天我在 HN 上看到「Package Manager for Agent Skills: Publish, Discover, Install Everywhere」,GitHub 上还有「skillstui」这种 TUI 工具让用户在终端里搜 skill。
skill 的市场地位,类似当年 npm 之于 Node.js、pip 之于 Python、crates 之于 Rust。每个时代都有一个包管理器成为生态的「事实入口」。Agent 时代的 npm 还没定型,但 2026 年下半年的信号是:会定型。
第三条:押「agent 工程的脚手架」。
zod 这种 43K star 的老牌 schema 校验库被重新顶到 trending 上,根本原因是 agent 工程里 LLM 输出几乎都要过一次 zod 校验。结构化输出 + 错误兜底,这事离开 zod 真的不优雅。livekit/agents 的 13.7K star 说明实时语音/视频 agent 不再是 demo,开始进生产。OpenAI Realtime API / Gemini Live 的标配后端就是 LiveKit。
GitNexus 更狠。46.5K star 但只有一个 main 分支,纯前端 + 本地索引。开发者验证门槛极低。它把「让 AI agent 真正理解代码库」这件事产品化了。以前这事只能靠 IDE 自己干(Aider、Cody、Cursor 各自一套),现在有个独立仓库把它做成 Neo4j 风格的本地代码图谱查询。
共同信号
把这三条放在一起:跨模型工具链 + skill 形态独立化 + agent 脚手架稳态供给。
开发者不再押单一模型了。
一年前大家押模型(开源 vs 闭源、Llama vs Mistral vs Qwen)。半年前大家押 IDE(Cursor vs Claude Code vs Copilot)。今天大家押的是「agent 时代的脚手架」:爬虫怎么搞、模型怎么切、文件怎么校验、代码怎么检索、技能怎么交付、实时音视频怎么接。
这件事的隐含信号是:单一模型不再是壁垒。模型层已经被商品化了,所有厂商的模型在大多数任务上效果差异已经小到不值得押宝。真正的差异化在脚手架层,你的 agent 能不能接上正确的工具、读懂正确的文件、用对正确的 skill。
skill 跨模型这件事还有个工程细节值得拆开看。我看了一下 last30days-skill 的仓库结构,它把 skill 设计成「跨平台的 prompt 模板 + 数据源插件」的形式:topics 里挂的是 bluesky / tiktok / polymarket 这种异构数据源,单一平台做不到这一点。这种设计的潜台词是「我不知道你用什么 agent 框架,我只要 SKILL.md 这个标准约定就够了」。Claude Code、Codex、Grok Build、Antigravity 都按这个约定加载 skill,谁先把这套做扎实,谁就先抢到 skill marketplace 的入口位。
这跟 npm 当年抢 Node.js 入口位的逻辑一模一样。npm 本身不写代码,但它做两件事:一是统一包描述格式(package.json),二是统一安装/解析协议。其他语言也有包管理器(pip、cargo、gem),但谁先把「事实标准」刻进开发者心智,谁就赢。
四、为什么我说这是押注期,不是别的什么期
把三条线摆在一起看。
架构层在押:「下一代 LLM 的主干是自回归、离散扩散、还是连续扩散」。押错了 = 几百亿美元的训练算力白烧。
产品层在押:「Agent 的正确载体是云端容器、桌面 CLI、还是 IDE 插件」。押错了 = 整个产品线的入口被对手抢走。
生态层在押:「Agent 时代的事实标准是 MCP 工具协议、skill 包管理器、还是 IDE 私有插件体系」。押错了 = 生态位被开源社区抢走。
三个押注时间窗口高度重合,都是 2026 年下半年。三个押注都不成熟,连续扩散没经过 100B 参数规模验证、ChatGPT Work 的安全机制没被实战检验、skill marketplace 还没定型。
三个押注的回报都巨大,赌赢任何一个就是下一代 LLM 工业的入场券。
这是押注期。不是技术爆发期(那种时期每个新模型都改天换地),不是产品成熟期(那种时期大家拼营销和渠道),是押注期,所有大厂都在下注,但没人敢说自己赌对了,所有人都在等对手先露出破绽然后抄答案。
反常识的洞察
十年老兵看 AI 行业有个朴素经验:真正的拐点不是所有人都看到新机会的时候,是所有人都看到新机会、但不知道谁会赢的时候。
2023 年是 ChatGPT 那一刻,所有人都看到了 LLM 的机会,但没人知道 OpenAI 会不会赢。结果 OpenAI 赢了。
2026 年是现在,所有人都看到了押注期的三个方向,但没人知道哪家会赢。这一年的赢家要等 2027 年才看得出来。
这里有个更深层的判断:押注期对所有玩家都不是平等的。OpenAI 和 Google 的现金流能撑住多线押注(自回归 + 离散扩散 + 推理时计算都投),Anthropic 和 NVIDIA 只能押一边,学术界和开源社区押的是技术赌注(连续扩散)而不是商业赌注。最后大概率是「OpenAI 赢产品、学术界赢架构、Anthropic 守住生态、Google 靠 Workspace 兜底」这种多赢格局。除非出现一个黑天鹅,比如某个开源团队真把 70B 连续扩散训到 GPT-5 同等水平,那整个局面会立刻翻转。
另一种可能更糟:所有押注都没分出胜负,市场进入「赢家通吃前的僵持期」,新玩家被卡住,老玩家继续烧钱。这种状态下受伤的是小厂和独立开发者。他们的工具选择会越来越窄,因为大厂开始绑定生态。
具体到 2027 年的拐点信号,我现在能想到三个值得盯的:
第一个,某个大厂把 70B 级别的扩散 LLM 跑出 GPT-5 同等水平。这件事一旦发生,自回归范式会立刻被重新评估,整个行业会在 6 个月内切换路线。
第二个,OpenAI ChatGPT Work 出第一次大规模 prompt injection 攻击事故。这种事几乎必然会发生,问题是发生之后用户是「用脚投票」还是「继续闭眼用」。前者会让 Anthropic 的本地化哲学拿到关键证据。
第三个,出现一个跨 IDE 的 skill marketplace 事实标准。这件事已经在发生了(skillstui、Package Manager for Agent Skills),但还缺一个「GitHub 时刻」,某个标准被全社区默认采用,从「可选」变成「必备」。
盯紧这三个信号。任何一个落地,押注期就开始收尾。
给普通读者的实操建议
如果你只是个用 AI 工具干活的人(不写模型也不做产品),押注期对你意味着三件事:
第一,别锁定单一模型厂商。Claude / GPT / Gemini / 开源模型(Qwen / DeepSeek / Mistral)现在效果差异在大多数任务上小到不值得你押宝。今天用得顺手的工具,三个月后可能就过时了。保持随时切换的能力比任何具体选型都重要。
第二,关注 agent 工程层面的工具链,而不是新模型。爬虫、数据清洗、文件校验、代码检索、实时音视频,这些是真正决定你工作效率的东西。GitHub 8 个稳态项目里,至少 zod 和 crawl4ai 是你今天就能用上的。
第三,留意 skill 生态的定型信号。现在 Anthropic 在推 Skills,OpenAI 在 Work 里塞了 223 个工具,开源社区在搞 skill marketplace。这三个里面谁先统一标准,谁就是 agent 时代的 npm。盯紧一点。
给开发者的实操建议
如果你在写 agent 或者写 agent 工具,押注期对你意味着三件事:
第一,别绑死单一模型 API。freellmapi 这种聚合网关今天能扛 34 家厂商,单 API key 自动 failover。月吞吐 74 亿 tokens 的量级证明这条路在工程上跑得通。你自己的项目要么用类似网关,要么做好多厂商适配层。
第二,skill 形态要往跨 IDE 走。Claude Code 的 Skills 是个起点,但别把项目绑定到 .claude/skills/ 这种目录约定上。topics 里挂 bluesky / tiktok / polymarket 多源数据点,按通用 skill 格式(SKILL.md 这种)交付。
第三,押 MCP 比押私有工具协议靠谱。MCP 已经是 Anthropic / OpenAI / Google 三家都接的事实协议。awesome-mcp-servers 93K star 不是白来的。私有工具协议只能让你在自家产品里舒服,跨产品就死。
五、尾声:押注期结束会是什么样?
押注期不会持续太久。历史经验是:基础设施层(这次是 agent 脚手架)的稳态定型需要 18-24 个月;架构层(这次是扩散 LLM)的赢家出现需要 24-36 个月;产品层(这次是 ChatGPT Work 这类形态)的赢家出现需要 12-18 个月。
也就是说,最迟到 2028 年中,押注期会结束。届时:
- LLM 主干架构会定型,是连续扩散、离散扩散还是自回归 2.0,会有明确答案
- Agent 载体形态会定型,是云端容器、本地 CLI 还是 IDE 插件,会有主流方案
- Agent 工具市场会定型,是 MCP、Skill 还是私有协议,会有事实标准
到那时候,今天押注的厂商里会有一批押对、有一批押错。押对的下个十年吃肉,押错的要么转型要么被收购。
作为普通用户和开发者,押注期是红利期,所有大厂都在抢用户抢开发者,工具免费、文档勤快、社区活跃。等押注期结束、赢家出现之后,吃肉的就是赢家,吃土的是被赢家收购或者被赢家挤死的小厂。
所以这两年别挑食。什么工具顺手用什么,多押几个方向,让自己在赢家出现的时候已经在赢家那边。
这是 AI 工业最好的一段时光。别错过。