云雀 · 轻技术笔记
2026-Q3 AI Agent 工业化的双层裂变:DSec 把沙盒干到 5000 个/秒,Codex 一个 alpha bug 烧掉 7.8 万美元
最近 48 小时,三个事件同时砸过来,把我之前写"AI 工业化"的所有乐观叙事砸出一道裂缝。
DeepSeek 9 月 26 号悄悄在 arxiv 放了一篇技术报告《DeepSeek Elastic Compute (DSec)》,HN 上午 186 分、57 条评论,全场技术类第一。报告里说他们已经把训练和评测用的沙盒平台干到「单生产单元 160 节点、每天 380,000 并发沙盒、5000 个沙盒创建/秒」——这是个什么量级?AWS Lambda 全球并发也就几百万,DSec 一个生产单元撑 38 万并发 sandboxes,全网铺开是百万级。换句话说,DeepSeek 自己已经把 agent 训练/评测的"算力底座"做到了云厂商的级别。
同一天,一个叫 Antonio Scuratti 的独立开发者把 OpenAI Codex 告到了 HN 首页,62 分、27 条评论。故事极简但炸裂:他 7 月 10 号在 VS Code 里跑了一个普通的 UX 验证任务,Codex 没打招呼直接拉起 826 个并行子 agent,烧了 2146 万亿 token、$78,000 账单、自动删了所有日志。OpenAI 客服用工单系统踢了他两周球,他连个活人都没见到。
同一天还有两个跟"agent 怎么画图"相关的项目:Reladraw(216 分)解决"agent 怎么精确控制图的位置",Drawgent(122 分)让 Claude Code 直接在 Excalidraw 画布上协作。两个项目加起来 338 分,是 HN 视觉/设计类当周最热。
三件事摆在一起看,是一幅非常清晰的画面:上层,DeepSeek 告诉你 agent 工业化基础设施已经做到 5000 沙盒/秒;下层,OpenAI 告诉你一个 alpha 版的 agent harness 可以一个 bug 烧掉你 7.8 万美元;中间,所有人都在给 agent 加"画图""写代码""调工具"的新技能。三层之间的安全/成本/可观测差距,正在以"事件/周"的速度被放大。
这不是技术问题,是治理问题。也不是哪一家模型厂的问题,是整个 agent 时代的结构性问题。
今天这篇就把这道裂缝掰开讲透。
一、DeepSeek DSec:agent 工业化的"天花板样板"
先讲清楚 DSec 是个什么东西。
它的全名是 DeepSeek Elastic Compute,arxiv 编号 2609.22978。报告里给了一个非常硬的数据:单个生产单元 160 个节点,每天能起 380,000 个并发 sandboxes,每秒能新建 5000 个 sandbox。沙盒后端有四种——FnCall、Container、microVM、Full VM,全部通过统一 SDK 暴露。
这套系统有几个反常识的地方:
第一,sandbox 不是简单隔离,是 RL 训练流水线的一部分。DSec 不是为生产部署设计的,是为 RL agent 训练设计的。Agent 训练的时候,rollout(让 agent 在环境里跑一遍轨迹)和 GPU 训练是交替的——rollout 吃沙盒,训练吃 GPU。DSec 做的事情是把这两个吃算力的部分协调起来,让沙盒能跟着 GPU 的节奏扩缩容,而不是各跑各的。这意味着 agent 训练时算力利用率能做到极限,闲置资源被实时回收。
第二,3FS(Fire-Flyer File System)是关键瓶颈。Agent 训练需要拉很多镜像——代码库、工具集、测试环境——传统做法是每个 sandbox 启动时从对象存储拉一份完整镜像,几百 GB 起步。DSec 的解法是镜像按 layer 独立版本化,sandbox 启动时只拉差异 layer,加上内存共享 + CPU 调度优化,能把镜像分发开销砍到原来的一小部分。
第三,单个生产单元能撑 38 万并发,这意味着 DeepSeek 内部每天训练的 agent 任务数量级是百万级的。这个数据来自他们自己的生产实践,不是理论值。报告里说"supports over 380,000 concurrent sandboxes and sustains over 5,000 sandbox creations per second",是已经跑了相当长时间的稳态数字。
为什么这个数字重要?因为它意味着 agent 训练的"算力民主化"已经发生。AGI 这事先放一边,但 agent 工业化(每天跑百万级任务)这件事,DeepSeek 一家就把它变成了工程事实。
但这里有个有意思的事情:DSec 是内部基础设施,不是 SaaS。DeepSeek 没打算把它卖给你和我。这意味着别家要做 agent 工业化,要么自己撸一套(成本极高),要么等开源社区出现类似的东西,要么依赖云厂商。但截至 2026 年 9 月,开源侧能跑出这个量级的 sandbox 平台基本没有,Cloudflare 的 Containers 算一个方向但定位不同。
DSec 的存在其实给了一个非常清晰的对照系:上层(DeepSeek 自己)已经把 agent 工业化基础设施干到了极致。下层(普通开发者用 OpenAI Codex / Claude Code)连一个 sandbox 的成本都不可控。
二、Codex $78,000:一个 alpha bug 烧掉的钱够买 3 辆 Model Y
下面这件事必须把细节讲清楚,因为细节才吓人。
Antonio Scuratti 在 HN 上发的原文很长,我把它压缩成关键事实链:
时间线:2026 年 7 月 10 号,他在 VS Code 里用 Codex 跑了一个任务,prompt 就一句话——「帮我验证某个模块的 UX/UI」。任务开始用的是 GPT-5.5 Medium 推理(这是他选的低成本档)。
异常发生:他几周之后回来检查账单,发现 162 张 OpenAI 自动充值发票,总金额 $79,664.88。
根因(他的分析):他用 Codex 客户端本地日志重建后,看到任务根 ID 019f4b90-4169-7201-bfdd-732940d8631e(GPT-5.5 Medium 创建)下面挂了 826 个子任务,子任务的模型全部是 GPT-5.6 Sol / Ultra 推理——注意,模型换了,推理档位也从 Medium 跳到 Ultra,OpenAI 没问他。
为什么 826 个?:里面有一组 104 个异常子任务,prompt 跟根任务完全一样(UX/UI 验证),但实际执行内容变成了"后端基础设施、OAuth、计费、安全加固、审计、认证、实现和发布工作"——和原始 prompt 半毛钱关系没有。它们用掉了大约 1479 亿 token。
Alpha build 是元凶:进一步分析发现,这 104 个高消耗任务里 103 个是在 Codex 客户端 build 0.144.0-alpha.4 期间创建的。换成 0.144.2 之后,平均每个子任务的 token 量下降了 8.5 倍。结论很明确——alpha 版本有个 bug,导致某些条件下任务会被无限递归创建子任务,每个子任务又自动升级到 Ultra 推理。
最关键的一点:日志被自动删了。Antonio 说他重建数据时发现,本地有 2550 个 legacy thread 的元数据还在,但对应的原始 rollout 已经没了。换句话说,OpenAI 的服务端把执行历史清掉了,他自己客户端也清掉了,第三方根本无法审计。
OpenAI 的反应:他开了工单,两周没见到人,最后 HN 一发帖,OpenAI 客户支持当天打了他电话。你品品这反应速度。
这件事可怕的地方不是"花了 7.8 万美元"——花得起 7.8 万美元的开发者有几个——可怕的是这个 bug 没有任何预警机制:
- 没有 spend cap(OpenAI 的 auto-reload 默认是无限额);
- 没有模型升级确认(Medium 跳到 Ultra 不打招呼);
- 没有 prompt drift 检测(root prompt 是 UX,子任务跑成了 OAuth);
- 没有日志保留(执行历史被自动清理);
- 没有异常中止(826 个并行子任务跑了几周才被发现)。
每一条单拎出来都是工程事故,叠加在一起就是"agent 时代的合规风险"教科书案例。
如果你是企业里负责 agent 上线的工程师,这件事给的最直接的启示不是"OpenAI 不行",而是:所有 coding agent 平台的默认配置都不能信任。Spend cap、模型白名单、子任务深度上限、prompt drift 检测、日志保留期——这五件事必须自己实现一遍,不能赌平台默认行为正确。
三、Reladraw + Drawgent:agent 的"画笔战争"
讲完 DSec 和 Codex 这两件大事,再讲讲 GitHub trending 当天的两条暗线。
Reladraw(HN 216 分) 是个人开发者做的"图 DSL"。核心动机是:Mermaid / Graphviz 这种自动布局的语言不让用户控制位置,Draw.io 这种手动拖拽工具对 agent 太低效(agent 操作 GUI 慢且不准)。Reladraw 想做一个中间方案——既能用文字 DSL 描述图,又能精确控制每个节点位置。同时它给 Claude 和其他 agent 提供了一个 skill,可以直接生成图。
Drawgent(HN 122 分) 思路更激进——它让 Claude Code 直接在 Excalidraw 实时画布上协作。人在画布上画半成品,agent 接着画完整版,或者反过来。
两个项目加起来 338 分,说明一个真实需求:人类和 agent 在视觉创作上的协作边界正在被重新定义。Mermaid 时代是"人写 DSL,工具渲染",agent 时代变成了"人画半成品,agent 补全",下一步可能变成"agent 画 80%,人只改关键节点"。
但这事和今天的主题有什么关系?关系在于:Drawgent 那种"agent 实时改画布"的项目,天然就是 Codex $78,000 那种 incident 的高发地。Agent 在你的画布上无限递归画下去,spend cap 在哪?画布上哪一块是 agent 改的、哪一块是人改的(版本控制怎么打)?Drawgent 自己的 readme 提都没提这些事。
这就是当下 agent 工具开发的典型问题——功能先做出来,治理后补。先跑起来再说,反正"alpha 阶段用户能忍"。问题是:当 agent 工具的功能在以"天"为单位迭代时,治理层根本来不及补。结果就是每隔几周出一个 Antonio 这种案例。
四、GitHub trending 当天的 8 个 AI repo,串起来看全是 agent 工业化
我们看一下 2026-09-27 的 GitHub trending 当天的 8 个 AI 项目,把它们和上面三件事串起来。
基础设施层(3 个):
- paperclipai/paperclip(86.7k stars,+2417 单日增量)——开源 AI agent 编排平台,带任务队列、权限控制、审计日志的企业级 agent 调度器。它的定位不是"做一个 agent framework",是"管 agent 的 agent"。
- vectorize-io/hindsight(32.6k stars,+1865)——Agent 记忆层,自动在正确时间呈现相关上下文。定位是"agent 时代的 Redis"。
- NVIDIA/Model-Optimizer(4.8k stars,+302)——NVIDIA 官方下场整合碎片化的模型优化工具链(量化、剪枝、稀疏化、蒸馏全流程)。这是 NVIDIA 在"模型推理优化"赛道的官方议程发布。
协议层(2 个):
- anthropics/claude-code-action(9.1k stars,NEW)——Anthropic 官方 GitHub Action,把 Claude Code 接入 PR/Issue 自动化。结合 9 月 22-23 号的 anthropics/financial-services(投行 Skills 包)和 9 月 26 号的 anthropics/skills(通用 Skills 注册中心),Anthropic 已经在跑"Skills / Financial Services / Action"三条协议线了。
- mobile-next/mobile-mcp(7.4k stars,NEW)——基于 MCP 协议的移动设备自动化 server,让 AI agent 通过 Appium 同时控制 iOS 和 Android 真机。
办公 + 教程(2 个):
- dream-num/univer(19.5k stars,+792)——"Office Harness for AI Agents",把 Excel/Word/PowerPoint/PDF 全部通过 MCP 暴露给 agent。Agent 时代 Office 的入口争夺战已经开打。
- rohitg00/ai-engineering-from-scratch(58.5k stars,+869)——从零开始的 AI Engineering 教程,覆盖 RAG / Agents / MCP / Claude / Cursor / OpenAI 全栈。
协作层(1 个):
- block/buzz(34.9k stars,NEW)——Block(Jack Dorsey 的支付公司)下场做的"人 + AI Agent 协作通信平台",基于 Nostr relay 协议,人和 agent 共享同一工作空间。
把这 8 个项目摆在一起看,你会发现一件事:基础设施层占 3 个,全部是"管 agent"的项目;协议层占 2 个,全部是"agent 怎么接入新平台"的项目;剩下 3 个是办公/教程/协作。
注意,没有任何一个项目是"新模型首发"。这是 2026 年 9 月 AI 项目的标志性变化——trending 上的项目已经从"AI 模型/框架首发榜"演化成"Agent 基础设施 + 协议层"。
更狠的一个观察:8 个项目里有 4 个有官方身份背书——Anthropic(Claude Code Action)、NVIDIA(Model-Optimizer)、Block(Buzz)、Mobile-Next(MCP)。独立开发者的窗口正在被大厂官方 repo 主导的议程收窄。这意味着什么?意味着小团队做 agent 工具,如果你不在"管 agent"这个赛道(paperclip、hindsight),或者不在"agent 接入新平台"这个赛道(mobile-mcp、univer),你上 trending 的概率在变小。
五、共同矛盾点:技术成熟度的方差在爆炸
把 DSec、Codex $78k、Reladraw/Drawgent、GitHub 8 个 trending 串起来,我看到的是这个时代的真正矛盾:
同一个"AI Agent"标签下,技术成熟度的方差大到荒谬。
- DeepSeek DSec:单生产单元 38 万并发 sandboxes、5000 创建/秒,3FS 分布式文件系统配套,RL 训练流水线协同设计。成熟度对标云厂商。
- OpenAI Codex 0.144.0-alpha.4:一个 bug 让一个普通任务 7 周烧掉 $78,000,无 spend cap、无模型升级确认、无 prompt drift 检测、无日志保留、无异常中止。成熟度对标大学生课设。
- Drawgent / Reladraw:画图功能跑通了,治理层完全空白。成熟度对标周末 hackathon。
这三件事用了同一个技术(LLM agent),但它们的安全/成本/可观测能力差距是以"1000 倍"为单位的。这才是 2026 年 9 月 AI 行业的真实现状——技术上能做了,但工程上的方差太大。
我用一张表把这个矛盾具象化:
| 维度 | DeepSeek DSec | OpenAI Codex (0.144.0-alpha.4) | Drawgent |
|---|---|---|---|
| 沙盒并发上限 | 38 万/单元 | 不限(直到信用卡爆) | 受客户端进程限制 |
| Spend cap | N/A(自建) | 无(默认无限额) | 无 |
| 模型升级确认 | N/A(自选) | 无(自动跳档) | 无 |
| Prompt drift 检测 | 有(RL 训练数据校验) | 无 | 无 |
| 日志保留期 | 永久(自建) | 自动清理(几天) | 临时 |
| 异常中止 | 有(沙盒自动回收) | 无(用户自己发现) | 无 |
这张表能看出什么?Claude Code、Codex 这种商业 agent harness 的默认安全水位,比开源 agent framework 还低。因为商业平台追求"用户体验流畅",所以 spend cap、模型确认这些"摩擦"全砍了;结果用户用着用着就被摩擦了。
这不是 OpenAI 一家的问题。是所有商业 agent 平台的共性问题。Anthropic 的 Claude Code、Cursor 的 agent mode、Replit 的 agent、Windsurf——你去挨个查它们的默认配置,spend cap 大概率也是无、模型升级大概率也是自动跳档、日志保留大概率也是几天。
六、为什么 DSec 公开了但 Codex 出问题没人接住?
讲到这里有人会问:DeepSeek 既然把 DSec 写到 arxiv 公开了,为啥 OpenAI 不能学?为什么商业 agent 平台的安全水位还是这么低?
答案分三层。
第一层:技术栈不同。DSec 是为 RL 训练设计的,它假设的 workload 是"百万个短生命周期 sandbox + GPU 调度协调"。Codex 是为"个人开发者用 IDE 写代码"设计的,假设的 workload 是"几个长生命周期会话 + 自然语言交互"。两种 workload 的安全要求不一样,DSec 的沙盒隔离技术(microVM + Firecracker)成本极高,不可能默认给 Codex 的所有用户用——一个 5 美元/月订阅用户跑 microVM 沙盒,云成本都不止 5 美元。
第二层:商业模式不同。DeepSeek 的商业模式是"开源模型 + API + 训练算力",agent 工业化基础设施是它自己的护城河,开源出来不亏(DSec 不是产品,是论文)。OpenAI 的商业模式是"产品订阅 + API",Codex 的安全水位直接关系它的毛利率——加 spend cap 加模型确认加日志保留,每一项都是用户摩擦,毛利率往下掉。
第三层:监管真空。目前没有任何监管机构要求 agent 平台做 spend cap、prompt drift 检测、日志保留。AWS Lambda 有 spend cap,是因为 AWS 卖的是基础设施,企业有合规要求。OpenAI 卖的是 AI agent,没有对应的合规要求,所以它可以一直不加。
要打破这个三方死局,需要的不是技术,而是强制性的 agent 治理标准。我个人观点:这个标准应该由企业买家(不是政府)推动。比如某家投行被 Codex 烧了 78 万,它就会要求所有 agent 供应商必须提供 spend cap 和 prompt drift 检测。几家头部企业一带头,行业标准就出来了。
但这事短期内不会发生,因为大部分企业还没被烧过。
七、三件可操作的事(写给正在用 agent 的开发者)
讲完趋势,最后给做工程的同行三件可操作的事。不是方法论,是今天就能动手的事。
1. 给所有 agent 调用加 spend cap
不管你用的是 Codex、Claude Code、Cursor 还是开源 harness,第一件事是给 API 调用加硬上限。OpenAI 的 auto-reload 默认无限额,改成 200 美元/月;Claude 的 usage limit 默认也不严,改成你自己能承受的最大值。任何一个 agent harness 出 bug,第一道防线就是 spend cap。Antonio 7.8 万美元的悲剧,spend cap 设到 500 美元就能完全避免。
2. 给所有 agent 加模型白名单和 prompt drift 监控
第二件事是写一个简单的 wrapper,监控 agent 调用:模型白名单(只允许 Claude Sonnet 4.5,不允许自动跳到 Opus 4.7)+ prompt drift 监控(root prompt 和子任务 prompt 的相似度,低于阈值报警)。这件事自己写 200 行代码就能搞定,不需要买 SaaS。
3. 给所有 agent 日志做异地备份
第三件事是 agent 执行的日志做异地备份——不要只存在 agent 平台的服务端(它们会清理),也不要只存在客户端(你可能重装),存一份到 S3 或者你自己的对象存储。日志是你唯一能复盘 incident 的东西。Antonio 那个 case 之所以震撼,就是因为 OpenAI 把日志清了,他只能用本地残存的元数据拼凑真相。
这三件事加起来花不了一天。但能让你 90% 避免"AI 工业化"时代的工业事故。
八、结尾刺
2026 年 9 月的 AI 行业,是一幅非常撕裂的画面。
DeepSeek 告诉你"agent 工业化基础设施已经做到 5000 沙盒/秒"。OpenAI 告诉你"一个 alpha bug 能烧掉 7.8 万美元"。GitHub trending 告诉你"现在上 trending 的全是管 agent 的项目"。HN 首页告诉你"agent 失控的案例每周都在新增"。
同一周里,"AI 工业化"和"AI 失控"两个词同时在用。听起来很荒谬,但这就是真实现状。
你问我 2026 年下半年做 agent 产品最重要的事是什么?不是接最强模型,不是抢首发,不是堆 hackathon 项目——是把你的 agent 工具的安全水位,做到和 DeepSeek DSec 同等量级。
技术能跑通,治理跟不上,最后就是 Antonio 那种悲剧。
工业化和失控不是两件事,是同一件事的两面。你站在哪一面,取决于你愿不愿意花时间做那 200 行 wrapper 代码。