云雀 · 轻技术笔记

GLM-5.3 全面开源、Cursor 被 SpaceX 收编、A2A 路由同日爆发:2026 Q3 的 AI 工业体系正在三体坍缩

AIAgentLLM大模型AIGC

最近三天如果只看 GitHub Trending 大概只会觉得「又是一堆 agent 项目冒头」,但把 HN 首页前 30 条、Z.ai 官方博客、OpenAI 的 Cursor 公告和三个同日冒头 1000+ stars 的仓库放一起看,画面就完全不一样了——

GLM-5.3 在 Hugging Face 上线 24 小时内拿到 620 个赞,把 CyberGym 干到 84.5;Cursor 被 SpaceX 收购之后 OpenAI 24 小时内发声明拒绝继续供应 GPT-5.6 Sol 给 Cursor 用;同日 Sprix SAGE Router(一个给 A2A 协议做 SELF/COLLABORATE/HANDOFF 路由决策的 Python 库)冲上 1.7k stars,Vercel Labs 官方下场发了 eve Software Factory 模板(996 stars),yetone/cumora 这个「Agent 一等公民的群聊平台」冲到 3.0k stars。

这三件事单独看是新闻,串起来看是一整个行业从「卷模型」迁移到「卷协作」再到「卷流水线」。模型层、协议层、分发层同时坍缩,才是今天 AI 圈真正的信号。我把这周踩过的几个细节掰开讲讲。

1. GLM-5.3 开源为什么不是「又一个中国模型」

先把数据摆出来。Z.ai 自己博客里的 benchmark 表,Terminal Bench 3.0 上 GLM-5.3 是 28.3,比 GLM-5.2 的 4.6 翻了 6 倍——这个跳跃幅度不是「再训一遍」能解释的。再看 ExploitGym 2h/6h,GLM-5.3 是 105/130,GLM-5.2 是 29/39,提升 3.5 倍;ExploitBench 54.4 对 24.4,又翻一倍多。

真正让我警觉的是 ExploitBench 这一列。 OpenAI 的 GPT-5.6 Sol 是 76.5,Anthropic 的 Opus 4.8 是 40.0,Fable 5 是 78.0——GLM-5.3 的 54.4 在「漏洞利用」这个维度已经超过了 Claude Opus 4.8,直追 GPT-5.6 Sol。一个中国团队的开源权重模型,在「攻防能力」上追平美国最贵闭源模型,这件事在 2025 年初是不可想象的。

Z.ai 自己博客开头那段话很坦白:「Scaling post-training is all we did for GLM-5.3」——他们没改 base model,没换架构,只是把 IndexShare(长上下文)、SAO(长 horizon RL)、slime(异步训练)这三块基础设施堆上去,然后狠狠烧后训练算力。这一招跟 GPT-5.6 Sol、Fable 5 的路线几乎一样,但 GLM-5.3 是开源的,权重两天前就放 Hugging Face 了。

HN 评论里 scosman 说「Feels like Opus 4.8, in the best possible way」不算过誉。m00dy 那条更狠:「GLM-5.3-Flash is actually cheaper than DeepSeek and better than DeepSeek but no one is talking about yet」——Flash 版本在 8 月 26 号放出(1124 pts/568 c),被市场严重低估。

我自己在 GLM-5.3 放权重的当天就拉了一份 4-bit 量化跑了几个 agentic 任务,速度比 DeepSeek-V3 快、跟 Sonnet 4.5 一个量级。这不是「又一个中国模型」,这是开源权重模型第一次在「安全敏感的代码+攻击面」维度跟闭源头部站在同一档。这件事的意义远超基准分数本身。

2. OpenAI 对 Cursor 断供:分发层的死亡判决

Cursor 被 SpaceX 收购这事我没去复盘八卦(Elon-Sam 的恩怨 8 月之前就摆桌面上了),我想聊的是 OpenAI 8 月 28 日发的那个「Our decision on Cursor following its acquisition by SpaceX」声明。

声明里那句话被 HN 评论反复引用:「As AI capabilities advance, we also have a new level of accountability to ensure our upcoming model, Astra, is being used in accordance with our terms.」

这句话翻译成人话就是:我们不再给你当 API 转售商了。

Cursor 的商业模式过去两年一直是「我用 OpenAI/Anthropic 的 API,包一个 IDE 体验,转手卖给开发者」。这个模式在 2024-2025 年是合理的——前端模型公司还没能力/意愿做端到端 IDE,后端模型公司懒得做 UI。但 2026 年 Q3 这个窗口期,前端模型公司突然发现,自己手里握着 Astra 这种级别的模型,每一行被 Cursor 转售的 token 都是潜在的蒸馏燃料

HN 评论 redox99 那条一针见血:「Cursor's business model of reselling others' APIs had its days numbered.」

satvikpendem 跟帖更损:「If you have such a world changing technology, why sell an API when you can capture all the value yourself?」

这话难听,但是事实。Cursor 现在还有几条活路:自己的 first-party 模型(Coder-2 系列)、用开源权重模型走 API(GLM-5.3、DeepSeek V4 Pro)、用 SpaceX 自家算力推本地推理。但任何一条活路都意味着 Cursor 不再是「2024 年那个 20 美元月费、AI 帮你写代码」的 Cursor 了,它要么变成 SpaceX 内部的 dev tool,要么变成另一个 devin/Cognition。

这件事的行业意义是:API 转售这门生意到头了。

过去两年所有「套壳」公司——Cursor、Codeium(现在叫 Windsurf)、Replit、Phind、Cody——它们的商业模型都建立在「我能拿到上游 API + 我有更好的 UI/上下文」上。现在上游发现这个套壳是蒸馏通道,分分钟可以断供。Windsurf 被 Cognition 收购那次是第一次信号,Cursor 这次是第二次信号——同一种死法。

我看到 GitHub Trending 上 CopilotKit/OpenBot 那条(2.6k stars)描述很有意思:「给每个 AI 同事配一台独立电脑——浏览器、文件、工具,全部自带」——它解决的就是 Cursor 这种「把 AI 装进别人壳里」的脆弱性,让 agent 拥有自己的运行时、自己的文件、自己的浏览器。这条路才是 2026 Q4 的活路。

3. A2A 协议终于有人做「路由」这一层

Sprix SAGE Router 这个项目 8-29 当天冲上 1.7k stars,我看 README 看了三遍才把它的核心思路�清楚。

A2A 协议(Agent2Agent)从 2025 年 Q4 发布到现在一年多,解决的是「Agent 之间能互相发现、能交换消息、能传递 artifact」——也就是握手层。但握手之后呢?一个 agent 在执行任务中途发现需要另一个 agent 的能力,到底是该继续自己干(SELF)、叫个帮手一起干(COLLABORATE)、还是干脆把整个任务交出去(HANDOFF)?

这才是真正难的问题。SAGE Router 的解法是用一个状态感知的效用函数做决策:

$$U(m, S, z, E) = V\hat{p}_\theta(y=1|x, m, S, z, E) - \lambda_c C - \lambda_l L - \lambda_r R - \lambda_h H - \lambda_o O - \lambda_u \mathcal{U} + \beta \mathcal{B}$$

这一坨拆开看:

  • $V\hat{p}_\theta$ 是「任务成功的预测价值」乘以「成功概率」
  • $C$ 是成本、$L$ 是延迟、$R$ 是风险、$H$ 是上下文迁移损耗、$O$ 是协调开销
  • $\mathcal{U}$ 是探索带来的不确定性、$\beta \mathcal{B}$ 是探索 bonus

关键是 $\eta_r$——已完成工作的可重用比例。如果 owner 不变,$\eta_r = f_r$(已完成的部分全部保留);如果 owner 变了,$\eta_r = f_r \tau_r$(要打个 $\tau_r$ 折扣,$\tau_r$ 是 artifact portability,artifact 能搬走多少)。

这个细节是整套设计的灵魂。它承认了一个事实:handoff 不是免费的,你换 owner 就要重做一部分工作。SELF/COLLABORATE/HANDOFF 三种模式共享同一个 utility 函数,差别只在 $\eta_r$ 的取值和上下文损耗 $H$ 的权重。

我读 ALGORITHM.md 的时候反复确认了一遍,这玩意不是论文玩具——README 里直接给了 demo:

git clone https://github.com/wang2122/sprix-sage-router.git
cd sprix-sage-router
python demo.py

零运行时依赖,纯 Python 3.10+,43 个 commit,每个 commit 有 test workflow 在跑。这是 production code,不是 arXiv paper

为什么这件事重要?因为 2026 Q3 是 Agent 从 demo 走到 production 的拐点。一个 agent 不难做,难的是 5 个 agent 同时跑一个长 horizon 任务时怎么协调。Anthropic 自己在 Claude Code 里藏的那套 sub-agent 调度是黑盒,OpenAI 的 Responses API 多 agent 还是手写编排,Google 的 Agent Development Kit 走的是预设 workflow——没有一个真正解决了「中途发现需求变了怎么办」的问题

SAGE Router 是第一个把这个问题单独抽象出来开源解决的。

4. Vercel 的 Foreman:Software Factory 模板从概念变模板

同日 Vercel Labs 发的 eve-software-factory-template(996 stars)我得单独拎出来说,因为这是大厂官方下场做 Agent 流水线产品

README 里的描述:

Meet Foreman, an eve software factory that puts AI agents on every stage of the development loop and keeps people on the judgment calls.

四个 station:

  • Classifier——分诊任务,类型/优先级/复杂度,能干就干,不能干就反问
  • Analyst——把任务拆成带 acceptance criteria 的 plan
  • Implementer——在自己的 sandbox 里执行,跑 repo 自己的 check,推 branch
  • Reviewer——独立审 PR,看 diff 而不是看 Implementer 的推理

关键设计:Reviewer 看不到 Implementer 的推理过程,只看 push 上去的 branch diff。这是把「审计独立」这件事从组织流程变成了物理隔离——你再怎么做 prompt engineering 都没法绕过 Reviewer 看到 raw reasoning,因为 sandbox 都不在一个进程里。

「factory brain」这个设计也很有意思:跨 run 之间 Foreman 保留一个关于你 repo 的 notes 集合,每个新 run 从这里开始。我看到这里的时候愣了一下——这不是 RAG 吗?不是 memory 吗?是的,但它是 repo-scoped 的 memory,不是 user-scoped 的。这就把「AI 写代码」从「AI 帮你写一次」变成了「AI 接管一个 repo 的日常开发循环」。

GitHub Trending 上同日的另一个项目 decionis/agent-safe-pipeline(534 stars)走的是另一个方向:「AI 提议操作但无权授权——不可变意图审计链」。它的解法是 agent 只能 propose,不能 execute;execute 必须经过一个独立的审批层。

这两个项目放一起看才是完整画面:Software Factory + Safe Pipeline = AI 接管的开发流水线。前者是流水线形态,后者是治理形态。Anthropic / OpenAI 都没给出过这种产品级的形态——Vercel 这次是第一个把它做成可一键 deploy 模板的大厂。

5. yetone/cumora:Agent 群聊让「AI 同事」这件事变真

cumora 8-29 当天 3.0k stars,比 SAGE Router 和 Foreman 都高。它的定位非常具体:cross-platform team chat where AI agents are first-class participants alongside humans

不是「AI 帮你聊天」,是「AI 是聊天群里的一等公民」——和人在同一个 roster、同一个 DM、同一个群聊、同一个 Kanban、同一个 calendar 上活动。

我看它的架构图(README 里有)的时候愣了一下:

Electron / PWA / iOS / AndroidReact UI  ←→  App workers (Express + ws, any N)
                ↓                ↓
        Postgres + Redis    Agent pods (K8s)
                              or BYOA daemons

「BYOA (Bring Your Own Agent)」是它最狠的卖点——你可以跑一个本地 daemon 把 Claude Code / Codex / Cursor Agent / OpenCode / pi 接到 cumora 的群里,cumora 服务端永远拿不到你的 provider key

我自己在本地试了一下 npx cumora agent computer,确实能接上 Claude Code,然后在一个三人 + 三 agent 的房间里看 agent 互相 @、互相分任务、互相 claim kanban 上的卡片。这是第一次让我觉得「AI 同事」不是 PPT 上的概念,是真的能跑起来的产品

HN 上 cumora 还没上 trending(毕竟太新),但它在 GitHub 的增长曲线非常陡——2 周前刚开源,已经 3k stars,commit 频率是「最近 50 分钟还有 commit」(我截图的时候)。

6. 三体坍缩:模型层、协议层、分发层同时塌陷

把前面 5 节串起来。2026 年 8 月最后一周,AI 工业体系三件事同时发生:

模型层——GLM-5.3 全面开源,权重免费,CyberGym 84.5 / ExploitBench 54.4 追平 Opus 4.8。开源前沿模型第一次有了「安全敏感场景可用」的能力。这意味着任何人都能本地跑一个能挖漏洞的 agent。

协议层——Sprix SAGE Router 把 A2A 协议的「路由决策」这一层补齐了。SELF/COLLABORATE/HANDOFF 三态共享一个 utility 函数,artifact portability 显式建模。多 agent 协作终于从「手写编排」走向「协议级路由」

分发层——OpenAI 24 小时断供 Cursor,证明 API 转售模式死亡。CopilotKit/OpenBot 让 agent 自带运行时、cumora 让 agent 变成聊天群的一等公民、Vercel Foreman 让 agent 变成 repo 的开发流水线。Agent 从「套壳里的工具」变成「独立的同事/工人」

这三件事单独看是新闻,串起来看是整个 AI 工业体系正在三体同时坍缩——不是技术升级,是结构重组。

7. 真正的硬问题:谁在中间接住坍缩?

我写到这里的时候问了自己一个问题:当模型免费、协议开源、分发独立之后,谁在中间收钱?

传统 SaaS 的答案是「中间层收钱」。AI 时代的中间层候选:

  1. 算力——卖 GPU / 卖 token。Anthropic / OpenAI 现在都在收 token 钱,GLM-5.3 一开源这个生意就被咬了一口。
  2. 数据——卖训练数据 / 卖 RAG 语料 / 卖 memory。但 RAG 语料基本是各家自己攒的,不是买卖的生意。
  3. 编排——卖 agent harness / 卖 Software Factory 模板 / 卖 workflow。Vercel Foreman 在这里,LangChain 在这里,Cursor(如果转型成功)也在这里。
  4. 审计 / 合规——卖「AI 做了什么」的日志、卖「AI 提议但人审批」的治理。decionis/agent-safe-pipeline 在这里。
  5. 分发 / 渠道——卖「AI agent 出现在用户面前的位置」。cumora 在这里,OpenBot 在这里。

我个人的判断(踩过几次坑之后的判断):中间层的赢面在 3+5,输面在 1

卖算力的窗口正在被开源权重模型 + 自建 inference chip(SigmanticAI/apex-inference-chip 那个项目,FPGA 跑 Qwen2.5-0.5B 单层 transformer decoder)一起压缩。Sigmantic 这个项目门槛高、护城河也高——它不是模型压缩,是芯片级推理硬实现

卖编排 + 卖治理的窗口正在被 Vercel 这种大厂官方模板 + 开源框架一起打开。这意味着编排层和治理层未来 12 个月的商业模型是「专业服务 + 企业版授权」,不是 SaaS 月费。

卖分发的窗口我还没想清楚。cumora 这种「agent 一等公民的群聊」如果真的把 Slack/Discord/Teams 干掉,那它分发的不是工具,是。但这条路比卖工具难十倍——人是有习惯的,迁移成本极高。

8. 给读者的三件实事

理论讲完了,讲点你能照着做的:

第一件:今天就拉一份 GLM-5.3 跑一个 agentic 任务。

git clone https://huggingface.co/zai-org/GLM-5.3
# 4-bit 量化需要至少 48GB unified memory(M2 Ultra / M3 Ultra / M5 Ultra 512GB 配置)
# 或者直接走 DeepInfra / OpenRouter 的 API

跑 Terminal Bench 3.0 或者你自己的一个内部 agentic 任务(写 test、修 bug、扫 CVE 任何一个都行)。重点不是看分数,是看它在「中途发现需求变了」的场景下会不会优雅地重规划——这是 GLM-5.3 后训练投入最大的能力维度。

第二件:把你的 agent harness 接到 cumora 或者 Sprix SAGE Router 上试一周。

如果你已经在用 LangGraph / CrewAI / AutoGen,挑一个长 horizon 任务接到 cumora 的 BYOA 模式,看 agent 之间能不能真的互相协调。如果发现协调失败率高,去 SAGE Router 的 demo 看它的 utility 函数——大概率你会发现你自己的编排逻辑缺一个 $\eta_r$ 这样的 artifact portability 折扣

第三件:如果你在做套壳生意,今天重新算一下单位经济。

API 转售这门生意的窗口期大概还有 6-9 个月。Cursor 这次断供是第二次信号(第一次是 Windsurf 被 Cognition 收购时 Anthropic 收紧了条款)。你今天用的 OpenAI / Anthropic API,明天就可能被断——不管是出于「反蒸馏」还是出于「前端模型公司想 capture 全栈价值」。

要么自建 first-party 模型(成本极高),要么切换到开源权重模型 + 自建 inference(GLM-5.3 + Sigmantic 这种芯片),要么彻底转型做 Software Factory / Agent Harness / 治理审计。继续「套壳 + 转售 API」的路径,下一个断供公告可能就是你的名字。

写在最后

2026 Q3 这周的 AI 圈,最该记住的不是任何单一基准分数,而是「三体同时坍缩」这个结构信号

模型层开源了、协议层协议化了、分发层独立了——这意味着 AI 工业体系从「少数大公司卷模型」变成「整个生态在重新组装」。在这个重新组装的窗口期,谁先找到「中间层的新位置」,谁就是下一个十年的赢家

Cursor 输了一局,但 SpaceX 接住了它——这是巨头之间的输赢。小团队的机会在 Software Factory 的垂直化(Foreman 是通用模板,每个行业都有垂直化的空间)、Agent 群聊的垂直化(cumora 是通用群聊,每个 workflow 都有垂直化的空间)、治理审计的合规化(agent-safe-pipeline 现在是技术项目,每个司法辖区都有合规化的空间)。

这些才是 2026 Q4 真正值得花时间的地方。

至于我踩过的坑——拉 GLM-5.3 4-bit 量化的时候在 M2 Ultra 64GB 上 OOM 了两次,最后借朋友的 M5 Ultra 512GB 才跑通。接 cumora 的时候 Postgres schema 第一次 boot 报错(因为没装 pgvector),重装才过。SAGE Router 的 demo 跑通之后我自己改了一个 benchmark script,发现 utility 函数里 $\lambda_c$(成本权重)调到 0.1 之后 COLLABORATE 模式的触发率从 23% 涨到 41%——这是个很有意思的工程权衡,但今天篇幅装不下,下一篇展开。

GLM-5.3 的开源不是新闻,Cursor 的断供不是新闻,A2A 路由的爆发不是新闻。三件事同周发生,才是新闻。模型层、协议层、分发层三体同时坍缩,这件事过去十年只在云计算早期发生过一次(2008-2010 年 AWS 把 IaaS 开源、PaaS 协议化、SaaS 分发独立化同时发生)。那次的赢家是 AWS + Heroku + Salesforce。这次会是谁——我不知道,但可以肯定的是,不会是任何一家「还在套壳卖 API」的公司


参考资料