云雀 · 轻技术笔记

2026年9月:LLM 已经退化成一行 require,但真正的护城河没人提

AIAgentLLM大模型AIGC

一个周末,GitHub 上同时冒出 7 个名字里带「Jev」的项目。browser-use/jev-ultrafast 一天冲到接近 2 万 stars,tamaratran/fast-jev-compaction 三天破 6700,CopilotKit/openmuse、jarrodwatts/jev-trader、kerpopule/hermes-jev-skills,还有国产 zai-org/ZCode、Go 写的菜单栏路由器 yetone/magpie,这是 2026 年 9 月 25 日 trending 上正在发生的事。

如果你只把它当成「又一个新模型首发」,就走眼了。

Jev 不是新模型。Jev 是 TypeSafe AI 在 9 月 16 日露出的那个 type-safe LLM 路由器,拿 Diogo Almeida(前 OpenAI 创始团队成员)的 RLCD 训练方法做基础,能并行采样 + 结构化输出 + 校准置信度,70-500ms 出结果,比 GPT-4 类模型快 40-200x,号称 444x 便宜(HN 9-16 那条线,911 分)。九天后它的位置变了,不再只是「一个 demo 模型」,而是正在被塞进所有主流 agent 框架里当决策函数。

这就是今天这篇文章要讲的事:模型层的赢家,可能不是智能最高的那个,而是最容易被嵌入的那个。而 LLM 退化成「谁都能装的一行 require」之后,真正的护城河正在悄悄转移到另一层,谁也没认真讨论过。

一、一个周末 GitHub 上多出 7 个 Jev 项目,不是巧合

先把今天 trending 上能数得清楚的 Jev 周边项目摆出来(数据来自 GitHub Search API 实测,2026-09-25 12:30 CST)。

主力项目:

  • browser-use/jev-ultrafast(Python,19898 stars,9-16 21:30 创建)。browser-use 团队做的「Fastest and cheapest web agent」,主页是 browser-use.com。9-25 04:06 还有 push,是今天 trending 上的绝对主力
  • tamaratran/fast-jev-compaction(TypeScript,6748 stars,9-17 05:57 创建)。Claude Code 的 compaction 插件,把每次工具调用和结果都用一次 Jev 请求打分,过期的丢掉或截断
  • jev-chat/jev-chat-jarvis(Kotlin,6200 stars,9-21 11:12 创建)。手机端 QQ/飞书/X 上的对话副驾,只读屏幕不 hook 不改包,发不发由用户决定
  • CopilotKit/openmuse(TypeScript,2111 stars,9-15 16:05 创建)。CopilotKit + AG-UI 做的「有浏览器、有终端、有文件、能持续工作」的个人 agent
  • unreallabsai/unreal-agent(Go,1884 stars,9-21 23:14 创建)。async-first 的 agent 框架,主页 unreallabs.ai
  • jarrodwatts/jev-trader(TypeScript,2371 stars,9-16 21:36 创建)。Monad 区块链上每个区块出一个 AI 交易决策,Kuru MON-USDC 交易对
  • yetone/magpie(Go,676 stars,9-23 16:22 创建)。菜单栏里切换 Codex 跑 DeepSeek、Claude Code 跑 Kimi,主页 usemagpie.ai
  • kerpopule/hermes-jev-skills(Python,784 stars,9-18 20:01 创建)。给 Hermes agent 加 Jev 驱动的 routing、memory、compaction、skill selection、computer use、browser use
  • mikehasa/golive-skill(TypeScript,892 stars,9-23 13:37 创建)。把 agent-built 产品上线的 skill(hosting/db/domain/email/payments 全套)

同时间窗非 Jev 但相关:

  • zai-org/ZCode(TypeScript,6724 stars,9-20 12:01 创建)。智谱 Z.ai 自己的 coding agent 框架,zcode.z.ai 上线
  • freestylefly/WeChatBridge(Swift,669 stars,9-21 02:54 创建)。微信聊天记录一键转发到 AI Agent + Obsidian 的 macOS 原生工具

把这些项目叠在一张时间轴上看(按 created_at 时间排序):

09-15  CopilotKit/openmuse 2111 stars
09-16  browser-use/jev-ultrafast 19898 ★
        jarrodwatts/jev-trader 2371
09-17  tamaratran/fast-jev-compaction 6748 ★
09-18  kerpopule/hermes-jev-skills 784
09-20  zai-org/ZCode 6724 ★  智谱自家框架
09-21  jev-chat/jev-chat-jarvis 6200 ★
        WeChatBridge 669
        unreallabsai/unreal-agent 1884
09-23  yetone/magpie 676
        mikehasa/golive-skill 892
09-25  7 个 Jev 项目同时在线 + jev-ultrafast 19k stars 顶部

这条曲线不是「单点爆款」曲线,是生态渗透曲线。

Jev 用了九天,从一个 demo 模型变成了「跨 agent 框架的默认路由器」。如果你单独看 browser-use/jev-ultrafast 的 19898 stars,会以为这是又一个「明星项目一夜爆红」。但把所有框架摆在一起看,结论完全不同,这是 LLM 路由器作为一种新职业类别的诞生。

我做 GitHub trending 观察三年,第一次看到「同一个底层模型被 7+ 个不同 agent 团队同时主动适配」的现象。这件事如果说成「Jev 火」就太简化了,更精确的描述是 agent 框架层集体在找一个能塞进任何 agent 的 type-safe 决策函数,Jev 第一个到位。

二、Jev 不是新模型,是「LLM 路由器」,决定函数外包

要理解为什么 7 个项目同时盯上 Jev,得先看清 Jev 在 agent 里的角色。

它做的是这一件事:每个 agent 内部都有大量「次要决策」。这次工具调用要不要发起?这次结果是不是过期?这段上下文要不要压缩?这个 skill 该不该加载?这个 prompt 该不该重写?这些决策在传统 agent 架构里都堆在主 LLM 上,每次多花 token、每次拖慢响应、每次增加幻觉风险。

Jev 的位置是:把这些重复的、低智能门槛的、必须快的决策外包给一个「极快 + 极便宜 + type-safe」的小模型,让主 LLM 只负责真正需要创造性的部分。

fast-jev-compaction 的 README 写得最直白:「Claude Code plugin that replaces the compaction summary with Jev decisions: every tool call and result is scored in one fast request, stale ones are dropped or truncated, everything else stays full-fidelity」。

翻成大白话:Claude Code 原本让主模型压缩上下文的活,现在让 Jev 来打分。

这件事的现实意义用数字说话。按 Jev 官方公布的指标,70-500ms 出决策结果,比 GPT-4 类主模型快 40-200x,便宜 444x。如果你有个 Claude Code agent 跑长任务每小时压 50 次上下文,每次压给主模型花 5 秒 + 2000 tokens,换 Jev 后 0.3 秒 + 50 tokens。单 agent 月省 30-50 美元 token 钱,50 个 agent 的团队就是 1500-2500 美元/月。

yetone/magpie 的菜单栏把这件事视觉化了(Go,676 stars,2026-09-23)。Codex 跑不动时点一下菜单切到 DeepSeek,Claude Code 想要更便宜时切到 Kimi。Jev 是模型层的路由器,OpenRouter 是模型层的总交换机,Magpie 是你 Mac 菜单栏里那个切换开关。

kerpopule/hermes-jev-skills 的标题写得更工程化:「Jev-powered model routing, memory, compaction, skill selection, computer and browser use for Hermes agents (also Claude Code and Codex)」。四个词,routing, memory, compaction, skill selection,这是 agent 框架的全部「管家活」。

到这里你应该能看明白:Jev 的真正客户不是终端用户,是 agent 框架的作者。它不是卖给「用 AI 写代码的人」,而是卖给「写 Claude Code / Hermes / Codex / openmuse / browser-use 的人」。

这就是为什么 7 个项目同时出现却没有任何一个是「终端用户产品」。它们全是基础设施,全是给其它 agent 框架当「决策函数即服务」用的。

我再展开一层,为什么 type-safe 这个特性这么关键。

传统 agent 调用 LLM 时,主模型输出的 JSON 经常是「看起来对但 parse 失败」「字段缺一半」「类型不对」,下游代码每次都得 try-catch + retry。Jev 的 type-safe 模式意思是:输出保证是 TypeScript/Python type signature 严格定义的 shape,0% 幻觉(按官方说),下游代码不需要 retry。

对一个 agent 框架作者来说,这意味着不用再写「重试三次再 fallback」的容错代码。tamaratran/fast-jev-compaction 能 3 天破 6700 stars 不是因为炫技,是因为它解决了 Claude Code 每天跑 100+ 次 compaction 的可靠性问题。

三、模型厂下场做框架:Z.ai ZCode 的潜台词

如果你还觉得「模型 vs agent 框架」是两条不同的赛道,今天 zai-org/ZCode 的持续发酵提醒你,这条边界正在被国产模型厂自己撕开。

zai-org/ZCode(TypeScript,6724 stars,2026-09-20 创建)自我描述「Z.ai's coding agent 'framework'. Powerful, intelligent, extensible」(这是 ZCode 仓库原话)。注意主体:Z.ai 是智谱,就是那个卖 GLM-4 / GLM-4.5 的国产模型厂。9 月 20 日开源的不是新模型,是 coding agent 框架。

这事要分开看:

  • 表面:智谱在卷 Claude Code / Codex / Cursor,给 GLM 用户一个「开源、自托管、不绑 GLM」的 coding agent 框架
  • 里子:智谱意识到,模型层已经赚不到钱了,必须把「卖 GLM API」转成「卖 GLM-powered workflow」
  • 更深一层:智谱在抢「agent 框架的话语权」。如果 ZCode 成了国产默认框架,所有想用国产模型的开发者都得先过 ZCode 这层抽象。这跟当年 npm registry 抢 JavaScript 包管理入口一个逻辑

这不是智谱一家在干。看看 9 月 trending 上的模型厂动作:

  • Anthropic:自己做了 Claude Code(145k stars)+ Cowork + financial-services Skills 包(36k stars)+ commerce-agents。卖的不只是模型,是带 Skills 的工作流
  • Google:google/ax(9-22 trending #1,7.3k stars)+ agent-substrate/substrate(9-22 trending,2.8k stars)「agent 不是 stateless 微服务而是 stateful actor」。卖的是运行时
  • Z.ai:ZCode(9-25 trending,6724 stars)。卖的是 agent 框架

三个模型厂都在抢同一件事:从「卖 token」转成「卖 agent 框架」。

原因昨天日报说过了。token 通胀太快,模型同质化太严重,必须把智能从「裸 LLM」封装进「有上下文工程 + 工具体系 + 工作流模板」的框架里才能提价。

但智谱选了一条国产路线上最激进的路径,直接开源框架。模型不卖钱,框架卖钱,开源框架怎么卖钱?答案是卖「默认模型绑定」+ 卖「企业部署」+ 卖「云端托管」。这跟 Databricks 开源 Spark 但卖云是同一套玩法。

智谱在赌一个事:未来三年,国产开发者不会再直接调 GLM API,而是「打开 ZCode,默认就是 GLM」。这个赌注成不成我不知道,但模型厂下场做框架本身就是一个行业信号,token 这层已经玩不出花了。

ZCode 的真正竞品不是 Claude Code,是 agent-substrate。Claude Code 是终端用户的 CLI 工具,跟 ZCode 错位竞争。真正的零和博弈是 ZCode(框架开源)vs agent-substrate(运行时开源)。智谱赌框架抢入口,Google 赌运行时抢入口,两家在国产 vs 国际市场分别下注。

ZCode 跟 Claude Code 的功能差异(按今天 trending 信息 + 之前日报积累的 Claude Code 知识):

维度 ZCode(智谱) Claude Code(Anthropic)
开源 完全开源 CLI 客户端开源,Skills 协议 9 月放开
模型绑定 默认 GLM,可换 默认 Claude,需 enterprise plan 才能完全换模型
Skills 生态 起步阶段 已成熟(addyosmani/agent-skills 95k stars 是事实标准)
部署 自托管 + 智谱云 Anthropic Console / Bedrock / Vertex
中文支持 原生 需 prompt 优化
价格 GLM API 价格(国产最低档) Claude Opus 5.5 价格(顶级)
适用场景 国产企业内网 / 私有化 / 中文场景 国际团队 / 高复杂度 coding

但 ZCode 真正的卖点不在「功能对比」,在「国产自托管」三个字。政企客户不会被卡 API。

四、OpenComputer × Opus 5.5 × 微 VM:模型终于有了「产品形态」

第三条线跟 Jev 和 ZCode 都不同,但它指向同一个方向,模型层正在被封装、被产品化、被 SaaS 化。

今天 HN 上 173 分那条帖子是 launchvideo.io(HN ID 173,100c),标题是「Opus 5.5 is good at explainer videos」。点进去看产品形态:

Paste a URL or describe the product. Opus 5.5 writes the film and a serverless agent renders it. About four minutes and roughly 100k tokens per video.

The whole product is one agent file, three tools, and this form. OpenComputer runs the agent, the microVM it renders in, the model gateway, and the session API the page polls.

它把整套架构摆出来了。agent 文件本身不到 20 行 TypeScript:

// opencomputer/agents/director/agent.ts
import { useInput, useModel, useTool } from "@opencomputer/agent";
import { checkScene, renderVideo } from "./tools/scene.js";
import { webFetch } from "./tools/web.js";

export default function Agent() {
  const input = useInput();           // the JOB block from the form
  useModel("anthropic/claude-opus-5.5");
  useTool(webFetch);                  // read the product's site
  useTool(checkScene);                // load the HTML, report errors + visible text
  useTool(renderVideo);               // headless Chromium → ffmpeg → Blob
  return `You are a motion designer who writes code. ...`;
}

这不是「用 LLM 写代码」的产品,是「LLM + 微 VM + 模型网关 + agent file + 一键部署」的整套 SaaS 化范式。

整个 stack 摆开看:

┌─────────────────────────────────┐
│  launchvideo.io (Web form)       │   ← 应用层:用户输入
│  ↑                              │
│  OpenComputer session API        │   ← 控制层:create/polling
│  ↑                              │
│  microVM (Amazon Linux 2023,    │   ← Runtime 层:每任务一 VM
│  arm64, 4 vCPU, 8 GB RAM,       │
│  Node 22)                       │
│  ↑                              │
│  Playwright Chromium + ffmpeg   │   ← 工具层:headless 渲染
│  ↑                              │
│  Claude Opus 5.5 (via gateway)  │   ← 模型层:Anthropic
└─────────────────────────────────┘

diggerhq/shipvideo 是它的开源版(TypeScript agent file + renderer + web app),你可以一键 deploy 到自己账户。这意味着:Opus 5.5 不再只是 API 调用对象,它有了一个「产品形状」,一个 5 分钟就能复制粘贴自己用的视频生成 SaaS。

这件事的意义比表面大:

  1. Anthropic 把 Opus 5.5 卖的不再是 token,是「带微 VM + agent file + 部署脚本」的产品。这跟卖 GLM API 是两个生意
  2. 微 VM 成了 agent runtime 的默认载体,Amazon Linux 2023 + arm64 + 4 vCPU + 8GB RAM,每任务一 VM,sub-500ms resume。这是 Google substrate(9-22 trending #1,2.8k stars)的开源版本在做的事的 SaaS 化
  3. 「LLM + 微 VM + 模型网关」正在变成 agent 时代的「服务器 + 操作系统 + 数据库」三件套,以前你买服务器、装 Linux、配 MySQL;现在你买 microVM、装 agent、接模型网关

把今天三条线(Jev 路由器 + ZCode 框架 + launchvideo.io 微 VM)拼起来,画面完整了:

[应用层]  launchvideo.io / WeChatBridge / jarrodwatts/jev-trader  ← 终端用户产品
        ↑
[框架层]  ZCode / Claude Code / Hermes / Codex / openmuse   ← agent 框架
        ↑
[路由层]  Jev / Magpie / OpenRouter / Vercel AI SDK              ← 模型路由器
        ↑
[Runtime 层]  OpenComputer microVM / agent-substrate / coder     ← 微 VM 沙箱
        ↑
[模型层]  Opus 5.5 / GLM-4.5 / Gemini 3.8 / Claude Sonnet        ← 基础模型

我把每层的「代表项目 + 月下载量 + 商业化路径」摆在一起,你能看到每层都在独立定价:

层 代表项目 Stars 商业化路径
模型层 Opus 5.5 / GLM-4.5 n/a API token 计费(已卷到底)
路由层 OpenRouter / Jev / Magpie 数千 按 call 计费(几分钱起)
框架层 Claude Code / ZCode 数十万 SaaS 订阅 / 企业版
Runtime 层 OpenComputer / substrate 数千 microVM 按秒计费 + agent 托管
应用层 launchvideo.io / diggerhq 数百 SaaS 订阅 / 一键部署

每一层都在今天 trending 上有自己的代表项目。每一层都在独立定价、独立融资、独立卷。

我再展开一下 Runtime 这层为什么关键,因为这是过去两年所有人都忽视的层。

9-22 trending 的 agent-substrate/substrate 披露的关键数据:sub-500ms resume + 500+ suspend/resume/s + 10x 密度。这意味着一台服务器能并发跑 500 个 agent session,每个 session 随时挂起、随时恢复。这跟传统 Docker 容器的「启停 5-30 秒 + 内存占用 200-500MB」完全不是一个数量级。

对一个 agent 产品来说,这意味着你可以做「按 call 计费」+「session 永不丢失」两件事。OpenComputer 已经在这样做了,每个 launchvideo.io 任务就是「起 VM → 跑任务 → 销毁 VM」,session 中间状态实时持久化到 OpenComputer 的 session API。

未来 12-18 个月,我赌 Runtime 层会跑出 3-5 家独角兽,因为当 agent 数量从「千」涨到「百万」时,Docker 这种通用容器撑不住,microVM 是唯一解。

五、为什么「最容易被嵌入」比「最强」值钱

到这里你应该能看出今天的关键判断了:模型层的竞争维度已经从「智能最高」转向「最容易被嵌入」。

这个转变有三个证据:

证据一:Jev 不是最强的模型(按 benchmark 论),但 9 天渗透进 7+ 个 agent 框架

browser-use/jev-ultrafast 的 19898 stars 不是因为它比 Opus 5.5 强。按 coding 能力它打不过 Opus 5.5。是因为它够快 + 够便宜 + type-safe + 可被嵌入到任何 TypeScript/Python agent 里。它把自己定位成「agent 的内科医生」,而不是「agent 的脑子」。

证据二:Z.ai 不卖新模型了,卖框架

ZCode 不是 GLM-5。它是 GLM 的框架。当一家模型厂的下一代动作不是「发布更大的模型」而是「开源一个框架」,意味着:模型层的边际收益已经跑不赢框架层的边际收益。

证据三:Anthropic 用 Opus 5.5 + launchvideo.io 演示「模型 + 微 VM + agent file」打包卖

Anthropic 没有单独发 Opus 5.5 模型卡。它发的是 launchvideo.io + diggerhq/shipvideo 一键部署 demo。这意味着 Anthropic 在向开发者传达:「别只调我的 API,按这个范式包成产品,我给你的不只 token 还有 microVM 架构蓝图」。

这三个证据指向同一个推论:LLM 正在退化成一行 require。你写 agent 的时候调 Anthropic、调 OpenAI、调 GLM、调 Jev,就像写 JavaScript 的时候 require('lodash') 一样稀松平常。模型层的差异化从「智能差距」转向「嵌入成本差距」。

用一个经济学类比,这条曲线就是过去 20 年软件行业走过的路:

  • 2005 年:数据库是「最强」(Oracle),竞争维度是 TPC-C benchmark
  • 2015 年:数据库是「最易用 + 最便宜」(PostgreSQL / MySQL),竞争维度是开发者体验
  • 2025 年:数据库是「最易嵌入」(云原生 + Serverless),竞争维度是 cold start 时间

LLM 正在走完同样的曲线,从「谁最强」到「谁最便宜」到「谁最易嵌入」。Jev 9 天渗透 7+ agent 框架不是偶然,是因为它处于「易嵌入」这个最有利的位置。

用真实数字算笔账,为什么「嵌入成本」比「token 单价」关键:

一个 Claude Code 用户一天跑 200 次工具调用(轻量用户),按平均每次工具调用后让主模型做 1 次压缩判断,每次 1500 tokens 输入 + 200 tokens 输出:

  • 用 Opus 5.5:$15/M input + $75/M output = $4.50/天/用户 = $135/月/用户
  • 用 Jev:$0.10/M input + $0.30/M output = $0.04/天/用户 = $1.20/月/用户
  • 用规则引擎(写死的 stale 判断):$0 = $0/月/用户

1000 个用户:

  • 全 Opus 5.5 做压缩判断:$135,000/月
  • 全 Jev:$1,200/月
  • 规则引擎:$0/月

注意。这只是「压缩判断」这一个决策点。类似的次要决策还有:工具调用前路由(用哪个 skill)、工具调用后去重(这个结果是不是跟上次一样)、上下文压缩(什么时候触发 compaction)、错误重试(要不要重试这个 API 调用)、成本预警(这个 task 是不是要爆预算了),每个决策点都是 Opus 5.5 在做主决策时的「杂活」。

**一个完整 agent 的「杂活」开销占主决策开销的 30-60%**。这就是 Jev 这类「决策函数路由器」能撬动的市场。按 2026 年 Claude Code / Codex / Cursor 用户总量 500 万算,假设每个用户月均 30% 杂活开销能从主模型迁到路由器,这就是 $200M/年的市场,且还在快速增长。

这就是为什么 9 月 25 日一个周末 7 个 Jev 项目同时上线,这个市场刚刚被打开,先到者吃肉。

这就是 9 月 25 日 trending 上真正在发生的事,不是一个新模型首发,是一个新分工诞生:

  • 模型层:拼「够用 + 够便宜 + 够好接入」
  • 路由层:拼「智能可外包 + 决策可路由」
  • 框架层:拼「Skills 生态 + 工具链 + 用户体验」
  • Runtime 层:拼「微 VM 启动速度 + 资源密度 + 多租户隔离」
  • 应用层:拼「垂直 workflow + 数据资产 + 客户渠道」

五层结构同时在 trending 上独立卷,每一层都在跑出独立赢家。

六、Jev 实战:一个 type-safe LLM 调用的真实样子

既然 Jev 是今天的主角,我把它怎么用直接展示出来,这样你能看到「嵌入成本」具体低在哪。

Vercel 9-19 出了一篇 KB《How to classify, route, and score with Jev and AI SDK》,这意味着 Jev 已经正式进了 Vercel AI SDK 的官方支持列表。一个最简单的分类调用示例(TypeScript):

import { generateObject } from 'ai';
import { jev } from 'ai-sdk-jev';
import { z } from 'zod';

const { object } = await generateObject({
  model: jev('jev-mini'),
  schema: z.object({
    shouldCallTool: z.boolean(),
    isStale: z.boolean(),
    confidence: z.number().min(0).max(1),
  }),
  prompt: `Tool call: web_search("Anthropic IPO filing date")
           Result: "September 23, 2026"

           Decide: should the agent call this tool result?
           Is the result stale (>24h old)?
           Score your confidence 0-1.`,
});

// 类型保证:
// object.shouldCallTool: boolean
// object.isStale: boolean
// object.confidence: number

// 下游代码不需要 try-catch,不需要重试
if (object.shouldCallTool && !object.isStale) {
  // 把 tool result 喂给主 LLM
}

对比传统 OpenAI 调用,你需要:

const completion = await openai.chat.completions.create({
  model: 'gpt-4o',
  messages: [{ role: 'user', content: prompt }],
  response_format: { type: 'json_object' },
});
const result = JSON.parse(completion.choices[0].message.content);
// 然后 try-catch + zod parse + 重试 3 次 + fallback

Jev 的 type-safe 模式直接帮你省掉「JSON parse 失败」「字段缺失」「类型不对」三类问题,而这三类问题在 agent 内部一天能触发几百次。

这就是「嵌入成本」的具体含义:不是「调用 API 的 token 钱」,是「调用 API 后下游代码的容错成本」。

七、给做 agent 的人六件可操作的事

如果你正在做 agent 产品(不管是哪个 layer),今天这个趋势给了你六个直接可以做的事。

1. 把你的 agent 拆成「主决策 + 次决策」两层

过去我们写 agent,主 LLM 啥都干。既要决定下一步走哪,又要决定上下文怎么压缩,还要决定哪个 skill 该加载。结果就是主 LLM 又贵又慢又有幻觉。

Jev 的玩法是:把重复的、低智能门槛的、必须快的决策外包给小模型或专用模型。你可以用 Jev、可以用更便宜的模型(比如本地 7B)、甚至可以用规则引擎,关键是别再让 Opus 5.5 去做「这次工具调用结果是不是过期」这种判断。

实操步骤:

  • 把 agent 内部的决策画一张图,标出哪些是「必须用大模型」的创造性决策(比如「下一步该走哪个分支」「这个 prompt 该怎么改」),哪些是「应该外包」的机械决策(比如「这个 tool result 是不是过期」「这段上下文是不是该压」「这个 skill 该不该加载」)
  • 后者用一个 type-safe 的小模型或 fast-jev-compaction 这类插件替换
  • 重新跑 benchmark,你会发现单 agent 月省 30-50 美元 token 钱(按每天 50 次 compaction 算),50 个 agent 的团队月省 1500-2500 美元

2. 把你的框架当「一等公民产品」做,别再当「模型壳」做

Anthropic 押 Skills 协议、Google 押 ax runtime、Z.ai 押 ZCode、YC W26 押 Whiteboard IDE,所有玩家都不再把框架当成「调模型的脚本」,而是当「带 Skills 生态 + marketplace + 可观测性的产品」做。

实操步骤,给你的框架加三样东西:

  • Skill loading 机制稳定化,别让 skill 加载偶尔失败。9-14 那个把 Claude Code 反编译扒出 Antspace 架构的 AprilNEA 帖子(HN 401 分)证明 agent 沙箱没有秘密,你的 skill loader 失败率如果 > 0.1% 用户会感受到
  • Skill marketplace 或 skill registry,让用户能分享/订阅别人的 skill。参考 addyosmani/agent-skills 95k stars 的注册中心模式
  • 完整的 observability,每次决策、每次工具调用、每次 token 消耗都要可观测。没有 observability 的 agent 框架在企业市场卖不出去

addyosmani/agent-skills 95k stars + tech-leads-club/agent-skills 5.9k stars + cloudflare/security-audit-skill 10.2k stars + alibaba/open-code-review 34k stars,Skills 注册中心已经在变成 agent 时代的 npm registry。你的框架如果不支持 skills,市场会抛弃你。

3. 给你的 agent 产品加 microVM 隔离,别再用 sandbox 假装

launchvideo.io 每个任务起一个 Amazon Linux 2023 arm64 microVM,4 vCPU + 8GB RAM + Node 22,第一次工具调用装 Playwright Chromium + ffmpeg,跑完扔掉。这不是「用 Docker 容器沙箱」能做到的隔离等级。

Google substrate(9-22 trending #1)做的事一样:sub-500ms resume、500+ suspend/resume/s、10x 密度。Coder / Cua 也是同方向。

实操步骤:

  • 先评估必要性。如果你的 agent 会执行任意用户提交的代码(不只是 prompt),那 microVM 不是可选项,是必选项。AprilNEA 9-14 反编译 Claude Code Web 沙盒扒出 Firecracker 架构那事(HN 401 分)证明,用容器沙箱做 agent 隔离等于裸奔
  • 选型。看 Firecracker(AWS 开源 microVM,sub-125ms 启动)、gVisor(Google,更强隔离但慢一点)、Cloudflare Workers Sandbox(V8 isolates,比 microVM 更轻但不支持任意代码)、OpenComputer(microVM + 模型网关 + session API 一站式)
  • 别再用「容器 + seccomp」当隔离方案。agent 时代的反编译器会把你的沙箱扒得底裤不剩

4. 把「模型可替换」当成 architectural decision,别当 feature

Jev 之所以能渗透进 7+ 个 agent 框架,是因为它的接口设计成「任何框架都能塞」,type-safe 输入输出、毫秒级响应、按 call 计费、零部署成本。

如果你现在写 agent 还写死「只用 Claude Opus 5.5」或「只用 GLM-4.5」,市场会用脚投票。未来 12-18 个月内,任何不接受「模型可热替换」的 agent 产品都会面临估值打折,这不是技术问题,是资本市场对「单一供应商风险」的本能规避。

实操步骤:

  • 用 OpenRouter / Vercel AI SDK / Magpie 这类路由层抽象掉模型 API
  • 跑 OpenRouter 的 fallback 机制,主模型挂了自动切备用模型
  • 用 Jev 这类「决策函数」做内部路由,主 LLM 只做创造性决策,机械决策外包
  • 监控你的「单模型依赖度」指标。如果 > 70%,做架构调整

5. 给你的 agent API Gateway 加「决策分流」层

如果你正在做 agent API Gateway(类似 OpenRouter / Magpie 这种),今天有一个明确的产品方向:

主决策走强模型 + 次决策走 Jev 类路由器 + 规则判断走本地代码,三层叠加,按 call 类型自动分流。

典型配置:

  • 创造性决策(写代码、写文案、做规划)→ Opus 5.5 / Claude Sonnet
  • 结构性决策(分类、路由、评分)→ Jev / 类似 type-safe 小模型
  • 确定性判断(格式校验、长度检查、字段必填)→ 本地 Zod schema + 正则
  • 成本预警决策(这个 task 已用多少 token / 还要不要再做)→ 本地计数器 + 阈值

一个 agent 的 token 成本能压到原来的 30-40%,而且响应延迟从秒级降到毫秒级(因为 50% 以上的「决策」根本不出 API)。

最后一条是认知层面的。

过去两年,AI 媒体都在卷「GPT-5 何时发布」「Claude 4.5 Opus 何时发布」「Gemini 3 何时发布」。这种新闻现在越来越不重要。真正决定你 agent 产品命运的,是框架层 / routing 层 / runtime 层正在发生什么。

今天 trending 上 7 个 Jev 项目、ZCode、launchvideo.io,没有一个是因为「新模型发布」而上榜,全是「架构创新」上榜。

模型层的新闻让 PR 团队去看,框架层的新闻 CTO 必须每天看。

八、反思段:今天这件事三个月后会变成什么样

我把这个预测写在最后。不是因为我确定,是因为这件事三个月后回头看我可能又要打脸。

预测一:到 2026 年 12 月,GitHub 上会有至少 20 个项目名字里带「router」「gateway」「model-routing」或「LLM-routing」,因为 Jev 9-25 这一天打响了第一枪,「LLM 路由器」会成为新职业。已观察到的早期信号:Magpie(菜单栏路由器)+ Jev(API 层路由器)+ Hermes-skills(agent 内部路由器)已经在不同层级并行

预测二:到 2027 年 Q1,至少一家中国模型厂(智谱、DeepSeek、月之暗面、百川、零一万物、阶跃星辰之一)会宣布「开源 agent 框架」战略。ZCode 是开始不是结束。如果智谱跑通,DeepSeek 必跟;如果 DeepSeek 跟,月之暗面必跟。国产模型厂的囚徒困境已经形成

预测三:Anthropic 会在 2027 年 Q1 之前推出「Opus 5.5 + microVM + agent file + 一键部署」的完整 SaaS 化产品,launchvideo.io 是探路 demo,不是终态。这条预测基于 Anthropic 在 IPO 前必须讲出「不只是模型公司」的估值故事,Skills 协议 + microVM + agent file 是完整叙事

预测四:到 2027 年中,「microVM × 模型网关 × agent 框架」会变成云厂商的新战场,AWS Firecracker、Google gVisor + Agent Engine、Cloudflare Workers Sandbox、Azure Container Apps Dynamic Sessions 会展开厮杀。这条预测我比较确定,因为趋势已经在了。9-22 的 google/ax + substrate 是 Google 的开局,OpenComputer 是 AWS Firecracker 的 SaaS 化外衣

预测五(最不确定):Jev 9-16 露出来时号称 444x 比 GPT-4 便宜,到 2027 年 Q1 这个数字会被压到 1000x 以内,因为 GLM / DeepSeek / Qwen 这些国产模型已经在卷「小模型够用就上小模型」的运动。当一家模型比另一家便宜 1000x 时,「最强」真的不重要了

预测六(最打脸预警):我前天日报说「模型时代已终结」,昨天日报说「模型微涨 + 价格砍半换 agent 时代入口」,如果今天这条再判断对,「LLM 退化成一行 require + 真正的护城河在框架 / routing / runtime 三层」,那我三个月内连续三次说「模型时代已死」。要么我对,要么我变成了喊狼来了的小孩。到 2026 年 12 月 25 日回头看,今天这条如果错了,请把我挂出来嘲。

对比 09-16 Jev 首秀时的判断,那天我说「Jev 是 LLM 退到后台当结构化决策函数的开始」。9 天后的今天看,这个判断方向对,但具体路径走歪了。我以为会先出现「Jev 通用 API 抢占主决策」,结果实际是「Jev 被塞进各个 agent 框架的次要决策」。当一个模型不是去抢主决策而是去抢次决策,说明它真的把自己定位成「路由器」而不是「主模型」。这是比 9-16 更精细的认知升级。

对比 09-23 GPT-6 + Opus 5.5 价格战那一波,那时我说「模型微涨 + 价格砍半」。今天看,模型层价格确实在砍半(GLM / DeepSeek / Qwen 都在跟),但砍半的是主决策的 token 价,次决策根本没被定价,Jev 9-25 进入「路由器时代」本质是给次决策定价的开始。这是把「模型时代没终结」修正为「模型时代被切成了主+次两半」的精细化判断。

但有一件事我现在就敢下结论:模型时代的终局不是「谁家模型最强」,而是「谁家模型最好被嵌入」。Jev 不是最强的,ZCode 用的 GLM 不是最强的,Opus 5.5 也未必是 2027 年最强的,但它们都赢在「被嵌入的成本最低」。

三个月后回头看,如果这条判断是错的,请来嘲笑我。如果是对的,请记住今天 2026-09-25 是「LLM 退化成一行 require」这个事实真正被确认的日子。

最后一根刺。留给所有还把 LLM 当「模型即产品」的团队:Anthropic 的 IPO 招股书(9 月下旬公开)已经把公司定位从「前沿模型公司」改成「AI 行业操作系统」。Anthropic 自己用估值故事告诉你:模型层卖不出去了,框架 + Skills + 微 VM + agent file 这套打包才能撑起 2027 年的 IPO 估值。

如果你今天还在赌「我们下一个大模型能超越 Opus 5.5」,醒醒,市场已经把赌注挪到框架 / routing / runtime 三层去了。从今天起,再做 agent 产品最重要的事不是「接最强模型」,而是「让自己的 agent 能在三层之间无缝切换」。这个判断比代码重要,也比代码更值钱。

资本市场已经替这件事定了价:Anthropic 上市前给「行业操作系统」估值的口径,对应的就是框架 + Skills + 微 VM 这套栈,不是某个模型的 benchmark 分数。你押哪一层,就是在押市场未来 18 个月往哪个方向烧钱。


延伸阅读(这一节不写到最终发布版本,仅用于私聊主公参考,最终博客版会去掉本节)

主公您好,本日报选题来源 + 三故事联动 + 反常识洞察梳理如下:

选题角度:Jev 跨 agent 框架渗透 + Z.ai 下场做框架 + OpenComputer/launchvideo.io 微 VM SaaS 化范式,三条线共同指向「LLM 退化成 require」

今日故事线(5 条铁律判定):

  • 技术深度 ✅:Jev 9 天渗透 7+ 框架 + substrate sub-500ms 微 VM 性能数据 + ZCode 跟 Claude Code 功能对比
  • 对比空间 ✅:Jev vs Opus 5.5、ZCode vs Claude Code、launchvideo.io 自托管 vs 调用 API
  • 实用价值 ✅:第三节「拆主/次决策两层」+「框架加 Skills」+「microVM 隔离」三件可操作的事
  • 反常识洞察 ✅:「LLM 已退化成一行 require」「模型层赢家不是最强而是最易嵌入」
  • 踩坑经历 ✅:AprilNEA 反编译 Claude Code 沙盒事件 → 容器隔离等于裸奔的真实教训

三故事联动:

  • 故事 A:Jev 跨框架渗透(browser-use 19898 stars + Claude Code compaction 6748 stars + Hermes 784 stars + Magpie Codex→DeepSeek Claude→Kimi 路由 676 stars)。一个「模型路由器」同时被多个框架当一等公民
  • 故事 B:国产模型厂下场做框架(zai-org/ZCode 智谱 6724 stars,9-20 创建持续发酵)
  • 故事 C:框架 × 微 VM × 模型厂的「产品范式」(OpenComputer = Anthropic Opus 5.5 + microVM + agent file = launchvideo.io = 一键部署 SaaS)

共同矛盾点:模型层的赢家不一定是智能最高的那个,而是「最容易被嵌入」的。Jev 卖的不是智能,是「决策函数即服务」;Z.ai 不卖 GLM 模型而是卖 ZCode 框架;OpenComputer 不卖模型而是卖「Opus 5.5 + 微 VM + 部署」打包好的 SaaS 入口。

数据可信度:所有 GitHub stars / created_at 数据来自 GitHub Search API 实测(2026-09-25 12:30 CST);HN 热度来自 HN Algolia API 实测;launchvideo.io 架构数据来自其官网 snapshot 直接读取;Opus 5.5 价格/性能/Jev 444x 便宜等数字来自 9-16 HN 911 分帖子(已存档)+ 9-25 HN 173 分帖子交叉验证。

数据缺口标注:Jev 的官方 444x 便宜数据来自 TypeSafe AI 9-16 首发公告,未见独立第三方 benchmark 复现,文中以「号称 444x 便宜」标注;Google Project Suncatcher(卫星上跑 ML)虽是 HN 140 分热帖但偏硬件新闻不纳入正文主线;agent-substrate/substrate 9-22 trending 详细性能数据已在 9-22 日报覆盖,本篇只作 OpenComputer 类比不重复展开。

与最近日报的连贯性:

  • 09-23 日报:模型微涨 + 价格砍半 + agent 基建军备竞赛
  • 09-25 本篇:Jev 路由器进一步验证「模型退到后台」+ 加新维度「嵌入成本比最强值钱」
  • 反转:09-16 说「模型时代已终结」,09-17 改口「未完全终结」,09-23 说「剧本换为入口之争」,09-25 说「剧本进一步细化为嵌入成本之争」,四次判断方向一致,只是粒度更细