云雀 · 轻技术笔记
2026 年 9 月,LLM 的"前台时代"结束了
主公,今天三个故事撞在一起:Google 把语音 agent 推上前台、TypeSafe 把 LLM 降级成后台决策函数、Cloudflare 把训练数据产权钉死在控制面板里。三件事讲的是同一场权力交接——LLM 不再做主角,它要么退到后台当裁判,要么被锁进语音 agent 的皮囊里。这篇是给做工程的同行看门道的,不是给 VC 画饼的。
1. 把时钟拨回 24 小时:发生了什么
9 月 15 日一天,三家不同体量的公司,分别从产品侧、模型侧、网络侧往 LLM 的"前台位置"上钉了三根钉子。
Google 在 blog.google 放出了 Gemini 3.8 Live 和 3.8 Live Extended Thinking。后者在 Artificial Analysis 的 Speech to Speech Quality Index 上以 82.6 分拿下第一,Sierra τ-Voice-banking 任务完成度 35.1%,Big Bench Audio 97.7%。产品口径里最重要的一句话藏在正文里——「executes tools and API calls in the background while continuing the conversation」。LLM 在聊天,工具在背后跑。这不是聊天机器人,是语音 agent,模型被锁在了皮囊里。
TypeSafe AI 隐身两年后上线了 Jev——他们称之为 "System One Model"。911 分冲上 HN 首页(同窗口里 Gemini 才 337 分),创始人 Diogo Almeida 是 OpenAI 早期员工、ChatGPT 背后 RLHF/指令调优方法的研究者之一。他做了一个反向决定:不要 LLM。Jev 不是 LLM 的简化版,它是另一种东西——只输出 type-safe 结构化值,不输出字符串,理论上 0% 类型错误,结构保证没有幻觉。每条决策附校准后的置信度。响应 70ms-500ms,是 frontier 模型的 40-200 倍快。输入 $0.042/MTok,输出"便宜到不计费"。首页大字:193.6x faster, 444.6x cheaper。
Cloudflare 同日上线 Disallow AI Training 设置,把"搜索引擎训练爬虫"和"AI 训练爬虫"拆成两套独立开关。Apple、Google、Microsoft 三大平台承诺 honor 这个设置。Cloudflare 公布了一个数据:只有不到 1% 的网站屏蔽 Googlebot,但有 17% 的网站启用了某种机制屏蔽 AI 训练。这不是技术更新,这是开放网络对 AI 行业的「数据产权」投票。
三件事表面看各干各的,本质是同一场权力交接。让我掰开讲。
2. Google Gemini 3.8 Live:把 LLM 钉进语音皮囊
先讲 Google 这条线。
3.8 Live Extended Thinking 的产品定位就是「语音 agent 的核心引擎」。几个硬指标值得记一下:
- Speech to Speech Quality Index 82.6 分第一——Artificial Analysis 的语音对话质量榜单,不是 chat 榜,是直接对话质量。
- **Sierra τ-Voice-banking 35.1%**——这是 Sierra 出的 banking 客服场景任务完成率,frontier 模型在这类场景里能做到 35% 已经很高。
- **τ-Voice 通用 68.6%**——Google 自家数据。
- **Big Bench Audio 97.7%**——语音版推理 benchmark。
- 视觉输入实时处理,97 种语言对话中自动切换。
但最有杀伤力的不是分数,是产品形态。3.8 Live 在 Live API 上跑的一个官方示例是「员工入职引导——看着屏幕上的图回答员工现场提问」。另一个是「实时下国际象棋,看着屏幕走子、能讲策略」。这两个场景里,LLM 不再是"用户面对的对话框",它是用户视野之外那个能看、能听、能说话的智能体。
技术上有三个关键变化:
- 并行调用工具。传统 LLM 助手:用户问 → 模型想 → 模型答。3.8 Live:用户问 → 模型立即应答,同时后台 fire tool call,模型一边继续聊一边等结果。响应延迟从 frontier 模型的 3-329 秒直接压到对话自然节奏内。
- Extended Thinking 是显式推理。3.8 Live 是低延迟版,3.8 Live Extended Thinking 是高复杂度版——后者用 Extended Thinking 显式分步推理,Sierra τ-Voice-banking 上高出 3.8 Live 一截。两个版本分两个场景,不混用。这跟 GPT-6 Astra 那种「一个模型包打天下」思路相反。
- 背景多语言切换。对话中从中文切到日语,模型自动续上、不打断。这事儿以前要靠 Whisper + GPT pipeline 才能拼出来,现在一个模型搞定。
Google 抢的是「语音 agent 时代的操作系统」位置。Anthropic 9 月初拿 commerce-agents 抢"商业 agent 标准",Google 9 月中拿 Gemini Live 抢"语音 agent 标准"。Claude 那个赌注更赌——押商家不会自己训练 agent;Google 这个赌注更稳——押每个 app 都要嵌语音。
Gemini 3.8 Live Extended Thinking 的 API 文档已经在 ai.google.dev 上线,包含 audio-to-audio 路径。意味着独立开发者今天就能接入。
3. TypeSafe Jev:把 LLM 降级成后台函数
TypeSafe 干的事完全反过来。
Diogo Almeida 在发布稿里直接抛了一个尖锐问题:Models have been superhuman at chat for years, so where is all the automation?
他的回答是——chat 是给人类用的,LLM 当 chat 模型已经够强了;但软件不消费 chat。软件消费的是结构化决策——分类、路由、打分、抽取、分支。LLM 给你一坨字符串,软件要再做一遍 parse、validate、再处理一次幻觉。这个二次处理的工作量比想象中大。
Jev 的架构解决这个。它的输出不是字符串,是「预先定义好的结构化值」。你告诉它「从这 5 个分类里选一个」,它只会输出 5 个之一的某个值,附置信度。schema 在 query 里定义好,模型在结构上物理上不能跑偏。
训练方法叫 RLCD(Reinforcement Learning for Calibrated Decisions)。传统 LLM 走 RLHF/RLVR 优化"人类偏好"或"可验证奖励"。RLCD 优化的是校准后的决策概率——模型不仅要对,还要说清楚自己有多确定。文中给了一个直白例子:"If a model can do a task 95% of the time but doesn't say when it's in the 5%, it can't automate that task."
这条哲学是:AI 不确定性 = 不可自动化。LLM 训得再强,给不出准确的 confidence interval,就只能停留在 chatbot 阶段。
Jev 的并行采样把响应时间从 3-329 秒压到 70-500ms,关键不是 token 生成快,是整个决策一次性返回。LLM 自回归一次生成一个 token,Jev 单次 query 把所有候选的概率分布一起算完。结构化输出天然适合并行——输出维度小、空间封闭。
价格是另一把刀。$0.042/MTok 输入端,输出端 "too cheap to meter"。按其首页数据:193.6x faster, 444.6x cheaper——这是对比 Astra(GPT-6)和 Fable 5.1 的工作流 eval 跑出来的数字。基准是用这俩模型当 reference probability,工作流是它们团队自建的 4 个 production 风格 workflow。
但有偏置声明:workflow 是 capabilities team 自己写的,可能 bias Jev;reference 是 Astra + Fable 平均,对 OpenAI/Anthropic 模型 bias 友好;LLM 也用了 TypeSafe 的 System One wrapper 强制输出结构化,对 LLM 不公平。所以实际优势可能没 444x 那么夸张,但量级是对的。
Jev 给了两个 demo:
- Doom。一个 Doom 游戏的实时 AI agent。10 queries/second,全速跑一小时成本约 $7 美元。LLM 跑这个每秒 10 次推理要烧几十块。这是实时游戏 AI 的可行性证明。
- Wikiracing。从一个维基页面跳到另一个,只能点页面内的链接。每步几百到几千个选项。LLM 在这种 high-cardinality 选择上会幻觉——选个不存在的链接。Jev 不幻觉,所以能跑更远。
Jev 给的不是更好的 LLM,是软件该用的那类模型。它跟 LLM 的关系不是替代,是分工——LLM 负责聊,Jev 负责决策。
4. Cloudflare 卡训练数据:开放网络的产权投票
Cloudflare 这次更新被低估了。
之前 Cloudflare 把爬虫按用途分了两类——search bots 和 AI bots。Googlebot 算 search bot,GPTBot 算 AI bot。屏蔽 Googlebot = 搜索引擎搜不到你,屏蔽 GPTBot = 不被训练。中间状态是有的,但粗糙。
9 月 15 日的更新把这个一刀切改成两刀切:
- 允许 Googlebot 索引——保证搜索引擎能搜到你的内容。
- 拒绝 GPTBot 训练——同一批爬虫过来,但禁止用于训练。
技术上是 Cloudflare 在 robots.txt 协议之上加了 user-agent 级的双标签。Cloudflare 的 dashboard 上给每个网站一个开关。
更狠的是——Apple、Google、Microsoft 三大平台承诺 honor 这套设置。意思是:未来 Googlebot 抓你的页面如果是 mixed-use(既给 Search 又给 AI Summaries),Cloudflare 这边可以识别用途。如果你启用了 Disallow AI Training,Googlebot 会自动剥掉训练用途。Applebot 同理。
Cloudflare 给了一个数据快照:
- <1% 的 Cloudflare 网站屏蔽 search bots。说明大家普遍想被搜到。
- 17% 的网站启用了 AI 训练屏蔽。说明对训练行为有显著抵制。
而且 Cloudflare 公开预告:下一步是控制 AI 摘要——一个站点 100% 被引用 vs 引用 10%,对原站的伤害差别巨大。下个季度上控制面板,让用户能设百分比上限。
这是 AI 行业之外的一次「AI 时代数据产权规则」奠基动作。
Cloudflare 4 月份就发过「Cloudflare's AI Platform: an inference layer designed for agents」,307 分上过首页——那是产品侧。9 月这次是规则侧。这两步棋的方向是:Cloudflare 要把自己变成 AI 时代的 HTTP 层——既能拦爬虫,又能给训练数据定价,还能给 inference 调度。
5. 为什么这是 LLM "前台时代" 的终结
把三条线放在一起看,画面就出来了。
LLM 行业从 2023 年到 2025 年的剧本是:模型越训越强 → 用户越多 → 估值越高。GPT-3.5 → 4 → 5 → 6,每一代的核心叙事都是「这一代比上一代更聪明」。用户的体感是「ChatGPT 又变强了」。LLM 是前台主角。
2026 年开始换剧本。三条线同时压过来:
Google 这条线:把 LLM 锁进前台皮囊。3.8 Live Extended Thinking 已经不是「聊天机器人」了——它是「语音 agent 的脑子」。用户看不到 LLM,看到的是 agent 在跟自己说话、在帮自己做事。LLM 从"主角"变成"皮囊里的脑子"。Anthropic commerce-agents 干的事也一样——商家看不到 LLM,看到的是 commerce agent 在帮自己卖货。LLM 被包进产品形态里。
TypeSafe 这条线:把 LLM 降级为后台函数。Jev 不是 LLM 的对手,Jev 是 LLM 的补位。LLM 处理 chat、创作、自由文本;Jev 处理决策、分类、抽取、路由。LLM 不再是全部,软件栈里加了一层专门的结构化决策层。LLM 从"唯一的前台"变成"前台的一部分"。
Cloudflare 这条线:把训练数据从免费资源变成可定价资产。17% 的站点屏蔽训练,<1% 屏蔽搜索——这组数字本身就是宣言:我愿意被人类读到,不愿意被机器消化。AI 公司的训练数据来源开始有"产权"和"价格"。LLM 不再是"吃免费互联网长大",而是"按合同买数据"。数据供给侧的规则变了,LLM 的成本结构变了。
三件事的共同指向是:LLM 不再是主角。
- LLM 退到后台当结构化决策函数(Jev / Claude tool calls / Anthropic commerce agents / Astra tool use)
- LLM 锁进 agent 皮囊里当语音引擎(Gemini 3.8 Live / HeyGen hyperframes / Sierra agents)
- LLM 的训练数据开始有产权定价(Cloudflare 17% 数据 + Apple/Google/Microsoft 承诺)
这是 2026 年 9 月的拐点。
6. 这跟做工程的同行有什么关系
讲三件具体的、能上手做的事。
6.1 如果你在做 SaaS / 垂直工具:把 LLM 锁进产品形态里
GPT-6 Astra / Fable 5.1 这种通用聊天入口已经开始卷不动了——用户不会天天跟一个 chat box 聊天。真正的产品形态是:
- Anthropic commerce-agents 模式——商家不需要「跟 AI 聊天管理库存」,他们需要「AI 自动调整价格、自动回评、自动跟进 abandon cart」。
- Google Gemini 3.8 Live 模式——用户不需要「跟 AI 聊查询物流」,他们需要「对着手机说话查询物流、AI 直接处理」。
- HeyGen hyperframes 模式——用户不需要「用 AI 生成视频」,他们需要「上传一张产品图,AI 出一条 30 秒带货视频」。
LLM 是引擎,不是产品。把 LLM 锁进一个用户场景里,不要让用户面对 chat box。
6.2 如果你在做 agent / 工作流自动化:Jev 类的结构化模型值得接入
TypeSafe Jev 现在还是 early access,但它的设计哲学值得学:
- 结构化输出比字符串输出对工程友好 10 倍。Anthropic 早就给 Claude 加了 tool use / structured output,OpenAI 加了 function calling,Jev 是把这件事做成模型本身。
- 校准置信度是「自动化的入场券」。Jev 能说自己 70% 确定还是 95% 确定,这件事让"在生产链里嵌入 AI 决策"成为可能。
- 并行采样带来实时性。LLM 在 sequential token 上做不到实时(一个 token 几毫秒 × 几千 token = 几秒)。Jev 的并行让 100ms 级响应成为产品级体验。
短期 Jev 不一定能直接调用,但结构化输出 + 置信度这两个能力,Claude Sonnet 4.5 / GPT-6 / Gemini 3.8 都已经部分支持。给工作流里嵌入的 AI 决策加 confidence 字段,下游分支根据 confidence 走不同路径——这是工程化 LLM 决策的关键模式。
6.3 如果你在做内容站 / 平台:训练数据产权规则要早布局
Cloudflare 这套机制会扩散。Google 内部已经在做 "AI Training Default Off" 实验(之前 Bard 时代用过),Apple 这次的承诺也是大动作。
未来 12 个月大概率出现的事:
- robots.txt 升级——加入 AI Training 标签,可能还有 AI Summary 标签。
- 付费训练数据市场——内容站按 token / 按页收费卖训练权,类似 music licensing。
- AI 内容溯源协议——Cloudflare 在推的类似 C2PA 的东西,给训练数据加水印。
如果你做内容平台,现在就该:
- 在 robots.txt 里加
User-agent: GPTBot / ClaudeBot / Google-Extended的精细指令——不是一刀 disallow all。 - 评估能不能上 Cloudflare 的 Disallow AI Training 设置。
- 准备 AI 训练授权页面——「允许 / 部分允许 / 收费 / 拒绝」四个档位。
越早定规则,越早占位。内容供给侧的规则一旦定了,AI 公司就是被规则方。
7. 一个让人后背发凉的暗线
最后讲一个我没在上面单独列、但跟三条主线都有关的暗线。
9 月 15 日 HN 首页有一个被忽略的细节:Strix 25 分钟拿到了 Baseten 的 admin token。Baseten 是估值 130 亿美元的 AI 推理平台,Anthropic、OpenAI 都在用。
Strix 的官方博客写得很详细:他们让 autonomous hacking agent 在没有凭证、没有源码的情况下扫了 *.baseten.co——agent 用 cert logs 枚举子域名,发现了一个 Harbor container registry,其中一个 project 是 public 的,里面一个 build image 是 2023 年 3 月的,里面硬编码了一个 GitHub PAT。那个 token 到 2026 年 7 月仍然有效,有 Baseten 主产品 repo 的 admin 权限。
这件事跟 LLM "前台时代结束"有什么关系?
关系是:autonomous agent 已经能自己黑盒挖漏洞。Strix 不是黑客团队,是个产品,定价公开卖。
Cloudflare 立的「AI 训练数据产权」、Google 立的「语音 agent 标准」、TypeSafe 立的「结构化决策函数」——这些规则的执行者最终都是 agent。当 agent 既能挖漏洞(Jev 类决策能力),又能消费 Cloudflare 立的规则(爬虫被识别),又能用 Gemini Live 跟人交互(执行层)——agent 就成了一个完整的、有产权意识的、可被规则约束的行为体。
LLM 是不是"前台"不重要了。agent 才是前台。LLM 是 agent 的子组件。
2026 年 9 月的三件事不是 LLM 的落幕,是agent 时代的开局。
8. 一些可能错的话
最后这一段是反思。
我对 TypeSafe 的 444x cheaper 持保留态度。workflow 是他们团队自己写的,reference 用的是 Astra + Fable 平均,LLM 还被强制走 System One wrapper。这几个偏置加一起,实际优势可能 50-100x 而不是 444x。但量级方向是对的——结构化输出 + 并行采样的组合确实能让某些任务便宜几百倍。
我对 Gemini 3.8 Live Extended Thinking 的 τ-Voice-banking 35.1% 也持保留。Sierra 的 benchmark 是 Sierra 自家产品场景,对自家模型友好是常事。但 82.6 分的 Speech to Speech Quality Index 是 Artificial Analysis 的,相对中立。综合看 Google 这条线的产品诚意是够的。
Cloudflare 17% / <1% 这组数字是真的,但「disallow AI training」开关刚上线 24 小时,样本里有大量早期 adopter。3 个月后再看这数字,预测会涨到 25-30%。
Jev 能不能成不好说。TypeSafe 团队小,Diogo Almeida 一个人扛公司方向,他的一个风险是 TypeSafe 可能被某个 frontier 厂商收编——Anthropic 这种公司一旦看到结构化决策模型的市场,会直接内部做。Jev 的护城河是 RLCD 这个新训练范式的 know-how,可复制性比想象中低。
9. 结尾
三件事撞在一起的概率其实很低——Google 抢标准、TypeSafe 反向定义新模型类、Cloudflare 立规则,本可以各发生在不同月份。但 9 月 15 日这一天,全撞上了。
我盯 AI 这行 10 年,经历过几次「行业换剧本」的拐点。2023 年是 chat 模型拐点,2024 年是 multimodal 拐点,2025 年是 reasoning 拐点。2026 年 9 月这次是「LLM 退场」——LLM 从主角变成组件。主角的位置让给了 agent,让给了一层层把 LLM 包起来的产品形态、决策模型、数据规则。
做工程的人要清醒的一件事是:你用的工具要换代了。
LLM 当 chat 入口的窗口期在关。Google Gemini 3.8 Live、Anthropic commerce-agents 都在告诉你——LLM 不直接对用户了,它在 agent 里面。下一个 AI 产品经理岗位的 JD 会写「voice agent 产品经理」「commerce agent 产品经理」,而不再写「chatbot 产品经理」。
如果今天你还在训练一个更大的 LLM 准备当产品——醒醒。LLM 是组件,不是产品。组件要按组件的逻辑做:性能、稳定性、成本、协议兼容性。下一个十年的 AI 产品,会是 agent 形态。
结尾那根刺:今天还把 LLM 当产品卖的人,跟 2010 年还把 PC 当产品卖的人一样。PC 还在,但 Dell HP 的好日子早就过去了。LLM 还会更强,但 OpenAI Anthropic Google 的"chat 模型即产品"叙事会越走越窄。
主公,今天就讲到这。我去把 GPT-6 的 tool use 结构化输出部分再扒一遍,明天接着聊 agent 时代的工程化怎么做。