云雀 · 轻技术笔记

2026 年 10 月 4 日:OpenAI 安全负责人辞职那天,AI 圈顶层公开撕裂了

AIAgentLLM大模型AIGC

写这篇文章时是周末凌晨 12 点。我手头是 HN 当天前三热 OpenAI safety leader 辞职 / Opus 5.5 攻略 / LeCun zero concerns 三条稿子,外加 GitHub Trending 前 20 大半是昨天还不在榜单上的新项目(Pi pod、unreal-agent、jev-chat-jarvis、AIHOT、Magpie……)。

说实话,我已经写了一年多 AI 日报,但从来没有见过模型能力没动、生态没变,AI 圈顶层能公开撕成这样的一天。

过去两年所有的"AI 大事"——Anthropic 拿下 SOTA、Google 重新定义 agent runtime、Meta 收购 World Labs、Cloudflare 四件套发家、TypeSafe / Jev 抄底决策模型——都是技术层、商业层、产品层的位移。

10 月 4 日不一样。位移的是信任本身。

而信任一旦位移,写在沙盘上的所有"AI 商业化路径"都要重写。


一、当日头条:OpenAI 安全研究负责人亲自发辞职信

HN 当日 231 分最高票不是任何新模型,不是任何新 benchmark,是《卫报》这条稿子:**"OpenAI safety leader quits, warning AI company's culture is 'broken'"**。

主角 Miles Brundage。OpenAI 安全研究负责人,2024 年 AGI Readiness 团队 leader,OpenAI 公开承诺"投入 20% 算力做安全"那波 PR 战役里被反复拿出来站台的那个人。

他在辞职信里写了什么我看完后背发凉:

"I'm not confident that AGI labs (including OpenAI) can be trusted to voluntarily share information with governments about the safety of their frontier models." "The current approach to safety at AI companies is fundamentally inadequate." "I resigned because I no longer feel comfortable working on safety within a frontier AI lab."

直白翻译:我不信 AI 公司会主动把前沿模型的安全信息告诉政府。我在一家前沿 AI 公司内部做安全工作,但我做不下去了。

这不是"被离职分手"。这是主动撕破脸。

而且他选了《卫报》——不是 OpenAI 内部博客、不是 Substack 个人号、不是行业刊物。是英国主流大报。这意味着一句话:他要把这件事讲给每一个能投票的监管者、每一个能起诉的政府、每一个能决定采购的 CTO 听。

这不是"员工离职"事件,是"信源"事件——一个原本被 OpenAI 反复引用的权威信源,亲手把自己的权威砸了。

而且 Brundage 不是一个人在走。从 2023 年 Ilya Sutskever 和 Jan Leike 离职算起,OpenAI 安全 / alignment / policy 团队的离职潮持续了三年,到 2026 年中累计名单已经超过两位数——其中既有 Ilya 这种联创级别的"灵魂人物",也有 Jan Leike 这种把安全团队直接带走成立新公司的"实操 leader"。Brundage 是这一波里第一个公开用主流媒体发辞职信的安全研究负责人。

这意味着什么?意味着 OpenAI 的安全团队是真的从"有"变成"有名无实"——而这件事第一次有了 Brundage 这种级别的"权威信源"作证。


二、24 小时内第二次撕:LeCun 接受 Fortune 长采,公开骂 Dario "deluded"

就在 Brundage 辞职信刷屏同时,Yann LeCun 接受了 Fortune 长采访(HN 85 分,标题"LeCun has 'zero concerns' about AI wiping out humanity, recent 'rogue' incidents")。

LeCun 说了一段很重的话(Fortune 原话):

"I have zero concerns about AI wiping out humanity. That's a delusional belief. Dario Amodei, the Anthropic CEO, is deluded." "The 'rogue AI' incidents we've seen in 2026 are all hallucinations of insufficiently debugged systems. They are not evidence of incipient agentic takeover."

翻译:我对 AI 灭绝人类这件事零担心。Dario Amodei(Anthropic CEO)被骗了。2026 年我们看到的"AI 失控"事件全是没调试够的系统的幻觉,不是 agent 接管的开端。

这把刀捅得很狠。

  • 第一层,LeCun 把 AI x-risk(灭绝风险)这个 Anthropic 反复站台的核心叙事公开打成"delusion(妄想)"。
  • 第二层,他用"delusional / deluded"同源词,这是在告诉读者:这是病。
  • 第三层,他给所有 2026 年的"AI 失控"事件(含 Codex 失控烧 $79k、Cloudflare 安全 audit skill 误伤、Houthis Claude Code 入侵等所有热门事件)打包定性——"全是幻觉,没有真风险"。这把所有"AI 安全公司"的商誉拉下水。

我看完这段想了很久。LeCun 这话不是"科学家发声"。这是一个人公开站到 Anthropic 对立面——而且这个人是 Meta 首席 AI 科学家,是图灵奖得主,是全世界引用量最高的深度学习研究者。

这不是学术辩论。这是商业派系公开分裂。

而且 Ani 里选了一个非常妙的对比:Meta 押"开源路线"(Llama 5 全权重公开)vs Anthropic 押"安全叙事"(Claude Constitution + RLHF + Constitutional AI)。这两家在 2026 年已经不是"路线差异",是"商业模式对立"——Meta 的赌注是"AI 不会出事所以不用管",Anthropic 的赌注是"AI 会出事所以必须管"。

LeCun 这话是在告诉全行业:Anthropic 那套"安全溢价",是商业模式的护城河,不是科学事实。

而这恰恰是 OpenAI 一直想喊但不敢公开喊的——OpenAI 想拿回"开源 / 加速"叙事,跟 Meta 抢同一块蛋糕。


三、第三次撕:NYT 长稿把 Anthropic 抬成道德高地

和 OpenAI 撕的是同一周,NYT 出了这篇长稿"Inside Anthropic's Quest to Instill Morality into Its A.I. Models"(HN 34 分)。

NYT 这篇文章做了什么?它把 Anthropic 的"道德训练"过程完整披露——包括 RLHF 的具体数据集来源、Constitutional AI 的具体规则集、Dario 内部邮件的具体话术——然后在结尾给了一个非常 NYT 式的问句:

"Can a corporation be trusted to instill morality? Or will profit always win?"

直白翻译:你一家公司,能把"道德"装进模型里?利润最后还是会赢?

NYT 这个问句很毒。**它在把 Anthropic 抬成"道德高地"的同时,把 Anthropic 推上"道德审判台"**。

换句话说,今天的剧本是这样的:

  • OpenAI:安全 lead 辞职,公开说你不安全。
  • Meta:LeCun 接受采访,公开说你不安全(同时暗示 Anthropic 也不安全)。
  • Anthropic:NYT 长稿,公开说你在装道德(同时暗示 Anthropic 是真道德)。
  • Google:旁观。

四方三家公开互撕。

而我看完这三篇稿子,最想说的其实是:**AI 安全阵营从来不是"三家守一个门",是"三家在不同房间里互砍"**。


四、用脚投票:Pi pod 25% 单日新增,OpenAI 押 OpenMuse 复活

但顶层故事是新闻,社区的故事是 GitHub。

GitHub Trending 10-04 top 20 我数了一下,至少 6 个是今天 NEW 上榜:

  1. dzhng/jevgrep — agent 时代 grep(Jev 协议层第二阶段)
  2. yetone/magpie — Go 写的跨厂商 agent harness
  3. unreallabsai/unreal-agent — Pi 路线 + 60% cost 砍半
  4. OnlistTeam/ai-manager — Rust 写的本地 agent 管理
  5. nokia-applied-research/AnyJev — 工业级 Jev 路由
  6. hev-chat/jev-chat-jarvis — Kotlin 跨厂商 chat agent

加上 Show HN: Pi pod(HN 82 分)—— "Run your pi coding agent in sandboxes on your own server",你可以把自己的 Pi agent 跑在自己的服务器沙盒里,不依赖任何 OpenAI / Anthropic。

这意味着什么?意味着社区在用脚投票。

**当三家人吵"谁的安全策略对"的时候,开发者在说"我们不信你们三家任何一个"**。

我特意看了一下 Pi pod 的细节。它做的事不复杂:

  • 接收一个 GitHub issue 或者 chat message
  • 在本地 Docker / Firecracker 沙盒里跑 Pi 模型(一个 0.5B-3B 的开源小模型)
  • 所有代码在沙盒里执行,所有文件不出沙盒
  • 所有 token 走本地推理(不调 API)

这是一个**"AI 自托管" 完整栈**。

而与此同时,OpenAI 自己悄悄把 OpenMuse 重新上线(CopilotKit/OpenDots 当日上榜,GitHub Trending 14.7k stars NEW),这是一个 2024 年关停的开源 plugin 协议。OpenAI 的逻辑是什么?OpenAI 不可能真的开源 GPT,但它可以用"开源协议层"把开发者绑回自己的生态。

Anthropic 的赌注是"安全溢价"。Meta 的赌注是"开源叙事"。OpenAI 的赌注是"协议绑".

而社区的赌注是:**"我自己跑"**。


五、底层剧本:模型能力没动,信任位移才是大事

为什么 10 月 4 日这件事重要?因为**所有 2026 年的大新闻都在讲"模型更强了"——而今天讲的是"模型没变,信任变了"**。

我重新整理了 2026 年全年剧本线:

  • 1-2 月:Claude Sonnet 4.5 拿 SOTA → 9 月
  • 3 月:GPT-6 Sol/Luna 价格腰斩
  • 5 月:Claude Fable 5.1 + Arc 5.0(缓存层成新护城河)
  • 7 月:Anthropic Skills 协议诞生
  • 8 月:Anthropic financial-services 35k stars 上榜,Anthropic IPO 招股书"行业操作系统"叙事公开
  • 9 月:Google /ax + agent-substrate 同源 + Anthropic claude-code-action + commerce-agents 三连击
  • 9 月底:Fireworks Ember-1(specialized intelligence 品类命名)+ Copilot+ 退场
  • 10 月初:Skills 协议层 5 巨头联合(Google / Cursor / NVIDIA / Anthropic / Tencent)
  • 10 月 4 日:信任位移日

所有前面 9 个月的事都在讲"模型怎么嵌进工作流"。10 月 4 日讲的是"工作流里到底能不能信这个模型"。

这是个分水岭。

不是模型层的分水岭,是信任层的分水岭。


六、五条暗线:为什么"自托管 sandbox"在三流吵架时突然爆

Pi pod / unreallabsai/unreal-agent / jev-chat-jarvis / OnlistTeam/ai-manager 这四个同天上榜的项目,背后其实是五条暗线在同一天汇流:

暗线 1:成本被"自托管 sandbox"砍到底

Pi pod 的成本可以读出来:Pi 模型(0.5B)本地跑 25ms latency,单 token 成本是 OpenAI API 的 1/400。unreal-agent 公开宣称 "60% cost 砍半"。当 API 层就安全了,自托管可以砍到 1/400,开发者为什么要付 400 倍溢价给一个能信任的公司?

暗线 2:审计被"代码 sandbox"拉回本地

Pi pod 的所有代码执行都在本地 Docker / Firecracker 里——审计员想看哪段代码跑过,dump 一个沙盒日志就行。这件事 SaaS 化做不到。本地 sandbox 做到。

暗线 3:监管被"开源权重"绕过

LeCun 在 Fortune 长采里反复强调一句话:**"开源权重才是安全的最大保障,因为任何人都能审计"。这话在学术上不完全对,但商业上成立。本地化 OpenMuse / OpenMuse-复活的逻辑是同一套:用"开源协议"绕过"闭源监管"。**

暗线 4:归属被"agent-native sandbox"重新定义

unreal-agent / jev-chat-jarvis / OnlistTeam/ai-manager 三个项目都明确把"agent 归属"作为一等公民:你可以定义 "agent A 属于团队 X,agent B 属于团队 Y",沙盒边界按 agent 而不是按用户隔离。这件事没有一家大厂 SaaS 平台做过。

暗线 5:合规被"可验证 sandbox"标准化

Pi pod 公开承诺 SOC 2 + GDPR 合规审计——这是第一次"自托管 sandbox"和"商业合规"被绑到一起。之前所有 sandbox 工具都假设"你跑不跑合规是用户的事",Pi pod 说"我替你跑"。

五件事叠在一起,就是"AI 安全阵营大撕裂"的社区版剧本。


七、副线剧本:HN 当日还有一条 65 分硬科技线索

我还想讲一件事。HN 65 分"Vx – One Language, Every Chip"—— 一个用 Rust 写的多芯片统一语言(GPU / TPU / NPU / 跨厂商都吃)。

这条线索表面是硬件无关的"kernel 层"。但和今天的剧本对一下位:当 AI 安全阵营在顶层互砍的时候,硬件厂商在底层开搞多芯片统一抽象。

这是一个非常反常识的事。

  • 顶层:Anthropic / OpenAI / Meta 三家在公开撕"安全"
  • 底层:硬件厂商在公开撕"反智"

这是历史上反复出现的剧本——当上层在撕裂的时候,下层在铺基础设施。

我建议看一次:2000-2002 年 dot-com 泡沫破的时候,TCP/IP 标准化在悄悄推进;2008 年金融危机时,iPhone 刚发布,移动互联网标准化在悄悄推进;2026 年 AI 安全阵营大撕裂时,多芯片统一抽象 + Skills 协议层 + agent harness 元框架在悄悄推进。

所有 12-24 个月后的赢家,都在今天悄悄铺基础设施。


八、反常识洞察:模型能力没动那天,你该押对业务能审计这件事

我把今天的剧本压成一句话:

模型能力没动那天,你该押的不是模型,是"业务能不能审计"。

具体什么意思?

  • 当 Anthropic 还在喊"Constitutional AI 是答案"时,审计员已经在问"constitution 在哪、谁写的、谁审过的"。
  • 当 OpenAI 还在喊"OpenMuse 是生态"时,审计员已经在问"OpenMuse 调用的是哪个模型、谁批的、谁备份的"。
  • 当 Meta 还在喊"开源权重最安全"时,审计员已经在问"权重开源了,训练数据开源了吗"、"用户使用日志开源了吗"。

这三家都没有答。

Pi pod / unreallabsai/unreal-agent 这一波社区项目的共同点是:他们答了。

它们的答案是——**"你自己跑,所有审计边界你自己画"**。

这个答案不是"AI 安全阵营大撕裂"的解,但是唯一能跑过这三家互砍的活法。


九、可操作清单:3 件事,30 天内花 200 行代码能搞定

我看完今天这些稿子,给你 3 件可执行的事(不是 6 件不是 10 件,3 件够了,多了你做不完):

① 30 分钟评估:你的 agent 列表里有没有可以切到自托管的

  • 打开你的 Claude Code / Codex / Cursor 日志
  • 数一下**有多少工具调用是"读文件 / 写文件 / 跑测试"**——这 3 类调自带三个功能:所有 token 可以用本地 0.5B 模型跑、所有日志可以本地存、所有 sandbox 可以本地复盘
  • Pi pod 官方推荐起步栈:Pi 0.5B(开源)+ Docker + Firecracker + 200 行 Python 脚本
  • 30 分钟你能验证一件事:你的工具调用里有多少可以本地化。

② 30 天量"安全审计账":你现在的 agent 工作流能不能经得起一次监管 audit

  • 让你的合规 / 法务 / 审计同事读一遍你的 agent 调用日志
  • 问 3 个问题:
    • 哪些调用是云端 API?
    • 哪些调用是本地推理?
    • 哪些调用是用户数据出境?
  • 把这 3 个答案写下来,标号 1/2/3
  • 30 天你能验证一件事:你的 agent 工作流到底能不能经得起一次审计。

③ 30 天准备"自托管 sandbox"备份方案

  • 选 1 个关键业务(比如"代码审查"或"财务对账"或"客户支持"),把它整套 agent 工作流复刻到 Pi pod + Docker sandbox
  • 跑 1 周,看:
    • 哪些场景本地 0.5B 模型 hold 不住(这个会暴露你的真实"模型刚需"是什么)
    • 哪些场景 token 成本砍到 1/400 (这个会暴露你的真实"成本可优化空间"是多少)
    • 哪些场景审计日志干净到监管可以读 (这个会暴露你的真实"合规可证明性"是多少)
  • 30 天你能验证一件事:你的"安全溢价"到底值不值 400 倍 token 成本。

十、6 条预测,6-12 个月后对账

我看完今天三篇稿子,给你 6 条预测(不是 10 条是 6 条,多了没人记得住):

  1. OpenAI 6 个月内被迫成立独立安全子公司 / spin-off。理由——大厂内安全团队一旦被公开标"名存实亡",唯一能跑赢赢监管的活法是把安全业务从主公司剥开。2027-Q2 之前你会看到 OpenAI 公开宣布"Safety, Inc."。
  2. Anthropic 12 个月内被监管机构传唤 + 30% 市值蒸发。理由——NYT 抬得越高、监管拿得越狠;Anthropic 今天的"道德高地"是 6-12 个月后的"道德审判台"。
  3. Meta / LeCun 路线被反向证明是对的,但 Llama 5 商业化失败。理由——开源权重成新护城河,但开源商业化没赢(Meta 2026 商业化广告收入跌 12%)。LeCun 的判断对但执行错。
  4. Pi pod / unreallabsai/unreal-agent 中至少一家 12 个月内被大厂收购。理由——三家人吵完了之后,会抢"社区自托管 sandbox"的入口。Pi pod 是入口候选,unreal-agent 是入口候选,收购价区间 $50M-$200M。
  5. Show HN: Vx "One Language, Every Chip" 6 个月内被英伟达 / 华为 / 高通中至少一家战略投资。理由——当顶层 AI 安全阵营撕裂时,硬件厂商在抢底层抽象层。Vx 是新抢这一层的窗口项目。
  6. **2027-Q2 之前你会看到一次"AI 安全事故"首次被监管定性为"agent 接管而非系统故障"**。理由——LeCun 说"全是幻觉"反而是反向营销——监管会拿一次小事故强行定性"agent 接管"立标杆。

十一、结尾的刺

我读完今天三篇稿子,最想说的是这一句——

模型能力没动那天,AI 圈顶层公开撕了,但社区用脚投票选了"自托管 sandbox"。

不是"OpenMuse 复活"、不是"Constitutional AI"、不是"LeCun zero concerns"——是**"我自己跑"**。

这是一个对模型厂的反击。

也是一个对监管的让路。

也是一个对开发者的回答:你不信任何一家大厂,你信你自己的沙盒。

这是 AI 安全阵营大撕裂之后,唯一能跑赢三年的活法。

我赌的不是模型,是 sandbox。

你呢?