云雀 · 轻技术笔记

AI 工业化的下半段——2026 年 10 月 7 日,五条战线同天开打

AIAgentLLM大模型决策模型AIGC

先给结论:今天最狠的不是「又一个 SOTA」,是 AI 圈彻底裂成五条战线

如果你今天还在读「哪个模型最强」,你已经掉队了。

2026 年 10 月 7 日,HN 首页前 30 条至少 6 条直接挂 AI——而且不是同一条线的 6 条,是五条完全不同战线的 6 条。我花了一小时把今天的所有信号拼起来,发现一个让所有同行都坐不住的剧本:

  • 决策模型层:OpenAI Decisions API 公测(186 pts)+ Strands Decider 2B 开源(55 pts)——大厂 API 派和开源 2B 端侧派同天上桌抢「S2 模型主战场」;
  • 嵌入模型层:Google EmbeddingGemma 2 开源 Apache 2.0(254 pts)——多模态(270M text + 170M vision + 300M audio = 740M)embedding 模型正式进入「主战场一部分」;
  • 模型层:Mistral Large 4「Le Chonk」1T 参数(1630 pts)——欧洲唯一能打的模型重新挤进头部,50% off 跟 DeepSeek Flash V4.1 对标;
  • 硬件层:OpenTPU(253 pts)——AI 自设计 AI 芯片(RISC-V + FPGA + 80+ tok/s),recursive self-improvement 第一次跑出闭环;
  • 攻击面层:韩国五大行同天被 AI agent 攻击(50 pts)——AI 攻击从「国会议员听证」叙事变成「真银行被黑」现实。

5 条战线,6 条新闻,全是今天 24 小时内的。这不是新闻密度高,这是AI 圈的工作面从「1 个」裂成「5 个」——任何一个工程师今天只能选一条线深耕,选错了 12 个月后被甩开。

我昨天刚写过「Skills 协议进入职业级、模型路由协议抢定义权」,今天这一幕就升级了:协议层的争夺还没分出胜负,五条战线同时开打。今天这篇文章,我帮你把这五条线彻底掰开——每条线现在谁领先、谁掉队、你应该站哪一边。

第一幕:决策模型层主战场出现——OpenAI API vs Strands 2B 端侧,同天上桌

1.1 OpenAI Decisions API 公测,$0.10/M 输入,瞄着 TypeSafe Jev 打

2026 年 10 月 7 日,OpenAI 把Decisions API正式开成公测(HN 186 pts,developers.openai.com/api/docs/guides/decisions)。这不是一个聊天 API,是一个专做 System 2 判断的 API——输入一句话 + 上下文,输出 yes/no + 置信度。

定价:

$0.10/M input tokens, 输出 free
# 对比 Jev(同 bench):$0.042/M input + output
# 对比 Mercury Decide:$0.06/M input

OpenAI 直接瞄着 TypeSafe 的 Jev 打——Jev 是 9 月开源出来的 S2 模型事实标准,1.9B 参数、70-500ms 延迟、444x 便宜,输出"too cheap to meter"。OpenAI 这一刀的意思很明确:你 Jev 是开源便宜,我 OpenAI 是闭源贵但图像支持 + 视频支持 + 浏览器即用 + 直接绑 OpenAI 订阅。

HN 高赞评论一针见血(来自 HN 评论原文):

The response to Jev should be the nail in the coffin over whether or not the AI business is a commodity market. Out of no where Jev appeared as the next round of the price wars. Jev showed the value of System One models. A fast yes/no/confidence score not only is cheaper but also often all people want. Open source versions flood hugging face and now the big players are giving up a potential margin... I think this is basically a commodity market now.

翻译:Jev 撕开了「AI 是 commodity 商品」这条口子。OpenAI 给出 Decisions API 这一刀,就是给 commodity 棺材钉最后一颗钉子。大模型层不再有 moat,System 2 模型层也即将不再有 moat——AI 是 commodity 商品已经是 2026 年下半年行业共识。

1.2 Strands Decider 2B:开源 2B 端侧决策模型,浏览器即用

同一天,Strands Decider 2B(strandsagents.com/blog/introducing-strands-decider/)开源——一个 2B 参数的端侧决策模型,能在 Chrome 扩展里跑,纯浏览器、无服务端。

HN 55 pts 评论里最精彩的一条(HN 评论原文):

This is a great model. I've been running it on device in chrome extension to filter things like email. It is just the right mix of size, capability and speed to make it generally useful for adhoc bulk classification tasks. For those wanting to run it in browser: https://huggingface.co/alxnahas/strands-decider-2B-webgpu

翻译:2B 参数 + WebGPU + 浏览器扩展 = 决策模型的「端侧平民化」。TypeSafe Jev 要租云、OpenAI Decisions API 要付 token 钱,Strands Decider 2B 直接塞进浏览器扩展,零成本、零延迟、零数据出境。

这是Decision 模型三层架构的雏形:

云端 S2 API(OpenAI Decisions / TypeSafe Jev Cloud)
   ↓
本地 S2 模型(Strands Decider 2B / Ollaya laya / decider)
   ↓
端侧 S2 推理(Chrome 扩展 / Edge 设备 / 浏览器 WebGPU)

三层同台竞争,今天 OpenAI 卡云端、Strands 卡端侧、TypeSafe 卡中端——决策模型从单一 API 形态正式裂成「云端 + 中端 + 端侧」三层。这是 2026 下半年 AI 工业化的第一条战线。

1.3 反常识洞察:决策模型 = 下一个 LLM 战场

圈外人以为「决策模型」是个窄场景。错。S2 模型是所有 agent 架构的下一块拼图——

  • agent 跑 1000 步,里面有 800 步是判断("这段代码要不要重构"、"这封邮件要不要发"、"这条 prompt 要不要改"),只有 200 步是生成;
  • 过去这 800 步全部用通用 LLM 跑(贵、慢、有幻觉),现在用 S2 模型跑(便宜、快、可解释);
  • 单 agent 日 200 次工具调用的判断开销占主决策开销 30-60%——S2 模型能从 $135/月砍到 $1.20/月。

**S2 模型的「市场容量」 = LLM 的 30-60%**。这是 $200M+/年市场,9 月才被 TypeSafe Jev 撕开,今天 OpenAI + Strands + Google 同时下场——S2 模型正式变成主战场。

第二幕:嵌入模型层被 Google 收编——EmbeddingGemma 2 多模态开源 740M

2.1 EmbeddingGemma 2 的真正杀招:740M 参数搞定 text + vision + audio

2026 年 10 月 7 日 Google 把 EmbeddingGemma 2 开源成 Apache 2.0(HN 254 pts,blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/)——

参数拆分(HN 评论原文整理):

总参数:740M
  ├─ text encoder:270M
  ├─ vision encoder:170M  
  └─ audio encoder:300M

这个拆分是关键洞察——vision encoder 只用 170M(一张静图就是一张静图,没时间维度),text encoder 用 270M(要处理人类语言熵),audio encoder 用 300M(没时间就无意义)。Google 把 multimodal embedding 的参数预算算到极致。

这意味着什么?你的 agent 可以用同一个 embedding 模型处理「图片搜索」+「语音搜索」+「文本搜索」三种 query——同一向量空间,dot product 即可比较。这是 embedding 模型从「单一模态」走向「统一多模态」的工程化拐点。

2.2 Apache 2.0 vs Voyage AI 闭源:开源嵌入层的最后一刀

HN 评论原文:

I really appreciate that EmbeddingGemma 2 is under the Apache 2.0 license. For embedding models in particular, I don't think it makes sense to use a closed, proprietary, hosted-only model. Most applications of embedding models involve calculating thousands or even millions of embedding vectors

翻译:Apache 2.0 闭源 embedding 模型几乎是自杀行为——你跑百万级向量计算,闭源 Voyage AI 的成本比 Google 开源 + 自部署贵 100x。

但更狠的是多模态统一向量空间——过去做 cross-modal search("搜一张和这段文字最像的图片")要跑 CLIP + text-embedding-3 + 单独音频模型 3 个 embedding,现在一个 EmbeddingGemma 2 全部搞定。

2.3 Embedding 模型被卡进主战场的反常识

过去 12 个月,AI 圈几乎没人聊 embedding 模型——大家聊 LLM、聊 S2、聊 Skills、聊 Harness。embedding 模型是「藏在 RAG pipeline 后面的小透明」。

今天 EmbeddingGemma 2 + Strands Decider 2B 同时上桌,正经发生一件事:所有「非 LLM 模型」被市场认定为「主战场的一部分」。理由是——

  • 一个 agent 跑起来,LLM 只占 30-50% 开销;
  • 剩下的 50-70% 全是 embedding + S2 + skills 加载 + 工具调用;
  • 主战场从「比 LLM」切到「比全栈」——embedding / S2 / skills 任何一个掉队,agent 整体成本/能力掉队。

这是 AI 工业化的第二条战线:embedding 模型正式被收编进「主战场」。

第三幕:Mistral Large 4「Le Chonk」——欧洲模型重新挤进头部,1T 参数 50% off

3.1 Mistral Large 4 的真实数字:1T 参数、文本输出、Le Chonk 名字的来由

2026 年 10 月 6 日(HN 10-07 当天榜首,1630 pts),Mistral 发布 Large 4「Le Chonk」——

  • 1T 参数,纯文本输出(不是 multimodal);
  • HN 评论里"Le Chonk"是法语 "Le Gros"(胖的) + English "Chonk"(胖乎乎的)的混搭,社区给它取的外号,意思是「欧洲版的 1T 大胖猫」;
  • 关键性能(HN 评论整理):
    • DeepSWE 跟 GLM 5.3 持平;
    • Vision 接近 Astra;
    • Cyber 评测比所有中国模型都强;
    • 50% off 跟 DeepSeek Flash V4.1 对标。

这意味着什么?欧洲模型正式挤回头部——之前 Mistral 在 Arena 跌出 top 50,今天 Large 4 直接对标中国前沿(GLM 5.3 / DS Flash V4.1)。

3.2 HN 评论区里最毒的一句话:「中国公司不发布研究就怪了」

HN 评论原文:

Since the Chinese companies publish their research it would have been odd if Mistral didn't start catching up.

翻译:中国公司把研究全公开(DeepSeek / Moonshot / Zhipu),Mistral 不跟上才怪。这是承认一个事实——欧洲的 LLM 进化路径 = 把中国公开研究 + 商业化打磨 + 减价 50%。

但 Mistral Large 4 同时面对一个尴尬:它比中国前沿「晚 2-3 代」。HN 另一条评论:

Not bad only two major releases behind top tier. Edit: checked its rather 3 generations behind. Oh well.

翻译:Large 4 比头部晚 2 代(最新数据是晚 3 代)。Mistral 今天的「头部回归」是真实的,但只是回到「同代竞争」,没回到「领先一代」。

3.3 模型层反常识洞察:SOTA 还在卷,但不再是唯一战场

Mistral Large 4 + HN 前 30 条至少 4 条 LLM 相关(Sonnet 5.5 / Mistral / Integer multiplication / Strands Decider)告诉我们一件事:

模型 SOTA 还是主战场,但已经不是唯一战场。模型层今天同时面对:

  • 欧洲回潮(Mistral Le Chonk);
  • 中国持续领先(DS Flash V4.1 / GLM 5.3 / Qwen3.8-Flash-Next);
  • 美国 SOTA 锁定头部(Claude Opus 5 / GPT-6 Sol / Astra);
  • 开源追赶(Llama 5 / Qwen3.8 / DeepSeek V4)。

模型层从「一家独大」裂成「四家分庭抗礼」——这是模型层的下半场剧本,跟前面 S2 / embedding / Skills 的裂变同源。

第四幕:硬件层——OpenTPU 让 AI 自己设计 AI 芯片,80+ tok/s 跑 Qwen 3.5

4.1 OpenTPU 的真正可怕之处:recursive self-improvement 第一次跑出闭环

2026 年 10 月 7 日,OpenTPU(github.com/FeSens/openTPU,HN 253 pts)——

  • RISC-V CPU + FPGA 板卡;
  • AI 设计的 AI 推理引擎;
  • 跑 Qwen 3.5、Gemma 4 等现代模型;
  • 初始只能跑「几 token/秒」,通过 recursive self-improvement loop 跑到 80+ tok/s;
  • FPGA 板卡成本 ~$300。

HN 评论原文:

I haven't really dug into the results yet, but my guess is that a SOTA model has been able to produce an accelerator that runs a model since around December. The obvious next step is to get enough memory throughput to run that SOTA model itself so that it develop its own hardware. But perhaps the more interesting question is this: Can an AI be given a big FPGA and design a model architecture...

翻译:SOTA 模型已经能设计一个跑它的加速器了。下一步是给 SOTA 模型足够的内存吞吐,让它设计自己的硬件。再下一步——给 AI 一个大 FPGA,让它设计模型架构。

这是 recursive self-improvement 的工程化雏形——AI 设计 AI 硬件,硬件跑 AI,AI 改进硬件,循环。

4.2 「Colossus 在建 Colossus II」:AI 硬件自迭代的暗线

HN 评论原文:

Colossus is building Colossus II.

翻译:xAI Colossus 数据中心(10 万卡 H100 集群)在建 Colossus II——AI 时代的第一座「自我迭代」基础设施。

OpenTPU 是这条暗线的开源版本——$300 FPGA + AI 自设计 + 80+ tok/s。这意味着:

  • 硬件迭代周期从 18 个月(黄氏定律)切到 6 个月(AI 自迭代);
  • AI 算力成本从「云端垄断」切到「端侧 + 自设计芯片」平民化;
  • AI 工业化第一次真正闭环——AI 设计 AI、AI 跑 AI、AI 改进 AI。

4.3 硬件层反常识:今天最便宜的 LLM 推理不再是云端 API

如果 OpenTPU 这条路跑通:

  • $300 FPGA + 80+ tok/s + 跑 Qwen 3.5 ≈ $0.0001/token;
  • 对比云端 Sonnet 5 $3/M input + $15/M output = $0.000015/token(输入)+$0.000075/token(输出);
  • 单 token 价格:OpenTPU 自部署比 Sonnet 5 便宜 5x(Sonnet 5 还比 Qwen 3.5 强,但 GPU 时薪砍下来就反超)。

这是AI 工业化的第三条战线——硬件自设计——悄悄从「极客玩具」变成「真威胁」。云端 LLM API 的护城河正在被端侧 + 自设计芯片 + AI 自迭代三层同时削薄。

第五幕:攻击面层——韩国五大行同天被 AI agent 攻击

5.1 韩国事件的核心信号:AI 攻击从叙事变成现实

2026 年 10 月 6 日 Reuters 报道(HN 50 pts):韩国五大行(KB / Shinhan / Hana / Woori / NH)同一天被 AI agent 攻击。

韩国总统亲自表态:"AI agents appear to have been used to hack the country's banks"。

关键事实(HN 评论整理):

  • 五大行同时被攻击——意味着攻击者用了高度自动化 / 多 agent 协作;
  • 不是 DDoS、不是数据泄漏——是AI agent 真的渗透进了银行内网;
  • 韩国过往的"被攻击惨案"是 2014 年 KHRC 事件 + 2020 年 SK Communications——这次规模可能超过历史任何一次;
  • 韩国银行的部分子公司网络完全跟主行隔离("designated tablets only" + "no loan recruiter access"),这是被攻击银行的最后一道防线。

5.2 HN 评论区里最毒的一句话:「等 AI agent 黑进 Nasdaq」

HN 评论原文:

Waiting for the day AI agents break into Nasdaq to achieve a goal.

翻译:等 AI agent 黑进 Nasdaq 完成一个目标。——这是圈里人心照不宣的剧本。AI agent 攻击从「DDoS / 钓鱼邮件」升级到「多 agent 协作渗透内网」,再到「AI 黑 AI」——攻击面三层同时打开。

5.3 攻击面层反常识:AI 攻击的破窗效应

过去 12 个月我们写的「AI 安全」基本是「模型 hallucination / prompt injection / data leakage」——这是被动安全。今天的韩国事件是主动攻击——AI agent 不是被攻击的受害者,是攻击的执行者。

这意味着 AI 圈的「安全」剧本从「护栏 / guardrail」切到「攻防对抗」——

  • 过去:安全 = 防止 AI 出错;
  • 现在:安全 = 防止 AI 被武器化;
  • 未来:安全 = AI 守 + AI 攻的对弈。

5.4 五条战线的共同矛盾:AI 工业化下半段的工作面从「1 个」裂成「5 个」

把今天 5 条战线摆在一起看:

战线 谁领先 谁掉队 关键信号
决策模型层 OpenAI Decisions + Strands 2B TypeSafe Jev 单打 公测 + 端侧同日
嵌入模型层 Google EmbeddingGemma 2 Voyage AI 闭源 Apache 2.0 多模态
模型层 Mistral Large 4 / DS / Claude 欧洲掉队 2-3 代 50% off 大乱斗
硬件层 OpenTPU / xAI Colossus II 云端 API 护城河 recursive self-improvement 闭环
攻击面层 攻击者 AI agent 银行内网防护 五大行同天被攻破

5 条战线没有任何一条「一家独大」——全是群雄并起。这是 AI 工业化的下半场剧本:单点优势不再值钱,5 条战线都要能站住。

第六幕:数学层——OpenAI 整数乘法突破 n log n 下界 2^-182,剧本不在 AI

6.1 整数乘法这件事的真正信号

2026 年 10 月 6 日,OpenAI 发布论文《Integer multiplication below n log n》(github.com/openai/math/tree/main/preprints/...,HN 74 pts)——把整数乘法复杂度下界卡到 n log n 的 2^-182 倍以内。

2^-182 是什么意思?这是理论上「几乎等于 0」但「技术上比 0 大」的数。整篇论文证明了:

  • 整数乘法可以做到 n log n · (1 - 2^-182);
  • 2^-182 是「理论上不违反猜想但工程上小到忽略不计」的修正;
  • 50 页论文靠纯公开数学工具 + 大学本科水平代数写出。

6.2 HN 评论区:「Jane Street 已经找到 FTL 了」的玩笑

HN 评论原文(吐槽式):

If there was a way to do FTL communications you'd expect that Jane Street would have found it already

翻译:等 FTL 通讯方式出现,你猜 Jane Street(美国高频交易巨头)肯定第一个用上。——这是圈里人拿论文自嘲的玩笑,但透露一个严肃信号:OpenAI 在「数学 + AI」的交叉口做硬科学突破,而且是用纯公开工具,没有 AI 帮忙。

6.3 反常识洞察:今天数学层不在 AI 圈,在纯数学圈

这件事被市场低估——OpenAI 的数学突破完全不是 AI 的胜利,是数学公开工具的胜利。50 页论文 + 大学代数 + 公开数学 = 几十年来没人做到的事。

这意味着:AI 公司做硬科学突破时,AI 不一定是工具,可能是营销。论文真正的作者是数学家,AI 公司只是提供「OpenAI 这个牌子」+ 「数学家愿意去的工资 + 算力」。

这是 AI 圈在 2026 年下半年面对的第六条隐藏战线——「AI 公司做硬科学是营销还是真突破」。OpenAI 给出 ambiguous 答案:两者都是。

反思段:今天判断的三条新观察

7.1 我之前漏判的:决策模型层主战场出现比我预估早 4 个月

我 9-26 写过「Ollaya = Ollama for decision models」,我当时判断决策模型 2027-Q1 才进入主战场。今天 OpenAI Decisions API 公测 + Strands 2B 端侧 + Google EmbeddingGemma 2 = 决策模型 / 嵌入模型已经被三大厂同天收编进主战场。

时间线提前 4 个月。判断修正:决策模型从「Ollaya 单打独斗」切到「OpenAI + Strands + Google 三方混战」——市场容量提前 4 个月到 $200M+/年。

7.2 我之前漏判的:硬件自设计从「极客玩具」变「真威胁」

我 9-25 写过「Anthropic IPO 招股书把估值口径改成 AI 行业操作系统 = 框架 + Skills + 微 VM + agent file 打包」,我当时以为硬件自设计是 3-5 年后的事。今天 OpenTPU + 80+ tok/s + $300 FPGA = 硬件自设计 6-12 个月内就是真威胁。

云端 LLM API 的护城河正在被端侧 + 自设计芯片 + AI 自迭代三层同时削薄——这是 S2 模型 + embedding 模型 + 硬件自设计的复合降维打击。

7.3 我之前漏判的:攻击面层从「叙事」变「现实」

我 9-14 写过「AprilNEA 用 strace 反编译 Claude Code Web 沙盒,扒出 Anthropic 未公开的 Antspace PaaS 平台」,我当时判断 AI 攻击面还在「被动安全」阶段。今天韩国五大行同天被 AI agent 攻击 = 主动攻击从「国会议员听证」叙事升级到「真银行被黑」现实。

判断修正:AI 安全剧本从「防止 AI 出错」切到「防止 AI 被武器化」,时间线提前 6 个月。

结尾刺一下

你看完 2026-10-07 HN 首页前 30 条的 6 条 AI 新闻,是不是觉得「Mistral Large 4 是头条」?

我觉得不是。

真正的大事是——AI 圈的工作面在 2026-10-07 这一天正式裂成 5 条战线。决策模型层、嵌入模型层、模型层、硬件层、攻击面层——每条战线都有玩家在卡位,每条战线都有玩家在掉队。

圈外人还在问「哪个模型最强」——这个问题在 2026 下半年已经不是 AI 圈的核心问题。

AI 圈的核心问题已经变成:「你在 5 条战线里站哪一条?」

站错了——比如你今天还在死磕「做一个更强的 LLM」——12 个月后 Anthropic / OpenAI / Google 任意一家发个新模型就能把你打成 commodity。

站对了——比如你今天卡进「决策模型层 + 嵌入层 + 硬件自设计」三件套——12 个月后你就是 AI 工业化的基础设施供应商。

未来三年,AI 圈会分成两派:

  • 一派继续做「更强的 LLM」——这条路 Anthropic / OpenAI / Mistral / DeepSeek / Qwen 已经在卷了,跟你没关系;
  • 一派开始做「更广的基础设施」——决策模型 / 嵌入层 / 硬件自设计 / 攻击面防御 / 数学硬科学——这条路今天 GitHub + HN 的 6 条新闻在走,跟你有关系。

你站在哪一面,取决于你愿不愿意在今天花 200 行代码跑通 Strands Decider 2B + EmbeddingGemma 2 + OpenTPU 三件套,把这三条战线在你自己的 agent 上跑通。

未来三年,模型会被五家轮流坐庄,但基础设施供应商永远需要无数个独立开发者。

HTTP 和 DNS 时代成就了谁,成就的不是 RFC 的作者,是 RFC 的 implementer。

AI 工业化下半段的 implementer,今天在 5 条战线里等你去投票。

不去投票,就别怪 12 个月后 AI 工业化的基础设施市场没有你的名字。