模型发布

Gemini 3.8 Live 与 Extended Thinking:完整指南、定价与可用性

Google 发布两款实时语音模型:一款面向规模与成本,一款能边推理边说话。本文给出完整官方定价表、Extended Thinking 交互协议、两个模型各自的可用平台,以及从 3.1 Flash Live 迁移时会遇到的破坏性变更。

两条发光的音频波形汇聚成一股流,象征对话与推理并行。
插图:两款 Gemini 音频模型——一款为实时规模化而生,一款能边思考边说话。

Google 于 2026 年 9 月 15 日发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking——其最先进的实时音频模型,同日在 Gemini API 正式可用(GA)。3.8 Live 主打规模、速度与成本:音频输入每分钟 $0.005、输出每分钟 $0.018。Extended Thinking 是独立模型,可以边推理边说话,在处理多步骤任务时同步播报进展而不中断对话。两者在文档中均为 Stable 状态,输入窗口 131,072 token、输出 65,536 token。

本指南基于 Google 官方公告开发者博客Gemini API 模型页、官方更新日志与 DeepMind 模型卡,核对时间为发布当天(2026 年 9 月 15 日)。

Google 发布了什么

@GoogleAI 的发布推文将这一对模型定位为"迄今最先进的 Gemini 音频模型":可以与之对话、协作,并把任务交给它。Google 主账号则强调生产化定位——"自然的、可用于生产环境的语音应用"。

Introducing our most advanced Gemini Audio models yet. Gemini 3.8 Live and 3.8 Live Extended Thinking let you speak, collaborate, and execute tasks seamlessly.

— @GoogleAI 2026 年 9 月 15 日

线程第二条推文给出了可用性矩阵——两个模型的发布范围并不相同。三条独立的第一方信息源(推文、两篇博客、API 更新日志 9 月 15 日条目)对发布日期与模型 ID 完全一致。

Availability: Gemini 3.8 Live in Search Live and public preview in the Gemini API; 3.8 Live Extended Thinking in Gemini Live, Workspace, and the Gemini API.

— @GoogleAI 2026 年 9 月 15 日

两个模型、两种定位

Gemini 3.8 Live 是低延迟主力:Google 的定位是"面向规模、速度与成本效率"。它支持句中打断、对话中实时切换语言(Google 发布材料称 97 种;详见下文争议点),并理解视觉上下文——在 Search Live 中把摄像头对准断掉的自行车链或漏水的水管,它会一步步给出语音指引。

Gemini 3.8 Live Extended Thinking 是拥有独立端点的另一个模型,而不是 3.8 Live 上的开关。它边推理边说话:在处理"策划一场活动"这类多步骤请求时,用简短的对话式填充句同步播报进展,让线路永远不冷场。API 协议把这一点显式化——客户端需要跟踪 interaction_status 信号(IN_PROGRESSIDLE),而不是把"静默"理解为"完成"。推理深度通过 thinking_config.thinking_level 设为 lowmediumhigh

记忆方式:3.8 Live 立刻回答你;Extended Thinking 当着你的面干活。值得注意的是,普通 3.8 Live 会直接拒绝 thinking_level 参数——想要思考能力,必须切换模型 ID。

基准速览

Google 的公告以 Extended Thinking 在第三方 Artificial Analysis 语音对语音质量指数上的领先成绩开场。以下全部为 Google 自报数据;指数方法论属于 Artificial Analysis,对比配置由 Google 选定。

官方柱状图:Artificial Analysis 语音对语音质量指数,Gemini 3.8 Live Extended Thinking 82.6,领先 GPT-Live-1 Astra 的 81.5 与 Grok Voice Think Fast 2.0 的 81.3。
语音对语音质量指数(Google 自报)。来源:Google 公告博客
评测3.8 Live Extended ThinkingGPT-Live-1 Astra (Medium)Grok Voice Think Fast 2.0 (High)
AA 语音对语音质量指数82.6(Google 自报第一)81.581.3
τ-Voice(语音智能体)68.6%67.9%56.5%
Sierra τ³-Voice-Banking35.1%32.0%16.5%
Big Bench Audio97.7%

需要诚实解读两点。第一,Speech Agent Arena 榜单上是普通 3.8 Live:Google 报告它位居第二(媒体报道其指数约 76.0%,每小时的输入音频成本约 $0.84,Extended Thinking 约 $3.50)。第二,Extended Thinking 的 82.6 相比 2026 年 6 月同一指数的状态(GPT-Realtime-2 以 77.2% 领跑,上一代 Gemini 3.1 Flash Live Preview 为 69.5%)是一次大幅跃升。以上均为 Google 自报,独立验证要等指数维护方发布。

官方柱状图:Sierra tau-cubed Voice-Banking 成绩,Gemini 3.8 Live Extended Thinking 35.1%,GPT-Live-1 Astra 32.0%,Grok Voice Think Fast 2.0 16.5%。
Sierra τ³-Voice-Banking,客服语音智能体基准。来源:Google 公告博客

定价与上下文

两个 3.8 模型在官方定价页共享同一行——Google 的价目表没有为 Extended Thinking 收取溢价。下表的按分钟计价与开发者博客脚注完全一致。

计费项免费层付费层
输入 — 音频免费$3.00 / 百万 token,或 $0.005 / 分钟
输入 — 文本免费$0.75 / 百万 token
输入 — 图片/视频免费$1.00 / 百万 token,或 $0.002 / 分钟
输出(含思考 token)— 音频免费$12.00 / 百万 token,或 $0.018 / 分钟
输出 — 文本免费$4.50 / 百万 token
Google 搜索接地所有 Gemini 3.x 共享每月 5,000 次免费请求,之后 $14 / 1,000 次

规模感参考:付费层上一次两分钟的语音对话(正常轮替)输入成本约 1 美分、输出不足 4 美分。免费层数据会被"用于改进产品",生产流量应走付费层。注意思考 token 按输出计费——Extended Thinking 的并行推理即使在不说话时也在消耗输出 token。

各平台可用性

发布范围切分得很干净,混淆两个清单是早期报道最常见的错误。DeepMind 模型卡为两个模型分别列出了分发渠道:

平台3.8 Live3.8 Live Extended Thinking
Gemini API + AI Studio是(推文称 public preview;文档称 Stable/GA)是(同左)
Search Live(消费者)是 — 摄像头 + 语音分步指引未列出
Gemini 应用(Gemini Live)未列出
Workspace:Docs Live未列出是 — Google AI Pro/Ultra
Workspace:Gmail + Keep Live未列出是 — 所有 Google AI 订阅用户
Gemini Enterprise私测私测
Google Cloud / Vertex AI模型卡声称支持模型卡声称支持

成熟度说明值得原样引用:发布推文称 Gemini API 上是"public preview",而 9 月 15 日的 API 更新日志写的是"generally available (GA)",两个模型页也标注 Stable。Live API 界面本身在文档中仍带 Preview 横幅。准确的表述是:模型 ID 为 Stable/GA,承载它们的 Live API 界面仍在预览阶段。Vertex AI 可用性是模型卡的声明,但发布时 Vertex 文档页仍返回 404——Cloud 可用性应视为"已宣布、文档未落地"。

Extended Thinking 协议

真正新的工程面在于 Extended Thinking 如何传递状态。在以前的 Live 模型上,turnComplete 事件意味着模型空闲、可以安全地发送下一轮输入。在 Extended Thinking 上这个假设不再成立:模型可以在说完一轮之后继续工作——调用工具、推理——然后再开口。客户端必须改为跟踪 interaction_statusIN_PROGRESS 表示推理或工具调用仍在进行,IDLE 才表示模型真正准备好接收输入。

另外两个契约变化对开发者很重要。Extended Thinking 上的工具必须声明为 NON_BLOCKING——阻塞式声明会直接报错,因为冻结会话的工具调用与"边说边干"的设计相矛盾。模型还会使用"对话填充句"——比如"我看一下"之类的短句——在工作时保持对话不断线,这正是 interaction_status 机制的用户侧呈现。

从 3.1 Flash Live 迁移

官方迁移章节列出了把 gemini-3.1-flash-live-preview 换成 gemini-3.8-live 时会破坏的东西,完整清单:

  • 模型字符串:WebSocket setup 消息中使用 models/gemini-3.8-live
  • 3.8 Live 不支持 thinking_level会话配置中直接省略 thinking_level/thinking_config——该模型不支持(Extended Thinking 接受 low/medium/high,不接受 MINIMAL)。
  • 异步函数调用成为默认:behavior: NON_BLOCKING。阻塞模式仍可通过 behavior: BLOCKING 兼容;函数调度(SILENTWHEN_IDLEINTERRUPTED)在 3.8 Live 上支持,Extended Thinking 上不支持。
  • send_client_content 全会话可用并支持显式角色,取代 3.1 的初始历史注入;turn_complete: true 现在会无条件打断正在进行的生成。
  • 主动音频永久开启:设为 false 会报错。
  • 情感对话已移除:删除 enable_affective_dialog
  • 轮次覆盖默认值变更为包含所有视频帧——需要控制上下文与成本时要显式控制帧。
  • 音频是唯一支持的输出模态:需要文本转录时要开启输出音频转录。

快速开始

Live API 是有状态的 WebSocket 会话:音频输入为 16 kHz 原始 PCM,输出为 24 kHz PCM,视频为不超过 1 FPS 的 JPEG 帧。最小 setup 消息只含模型字符串;语音、工具、VAD 灵敏度与转录开关都挂在会话配置上。Google 推荐的生产路径是:客户端直连场景使用 ephemeral token 而非裸 API key。

// WebSocket setup 消息(最小)
{
  "setup": {
    "model": "models/gemini-3.8-live",
    "response_modalities": ["AUDIO"]
  }
}

// Extended Thinking:独立模型 ID + 思考级别
{
  "setup": {
    "model": "models/gemini-3.8-live-extended-thinking",
    "response_modalities": ["AUDIO"],
    "thinking_config": { "thinking_level": "medium" }
  }
}

最快的上手路径:在 AI Studio 里直接体验(ai.studio/live,选择 "Stream"),克隆 Google 的 Live API 示例仓库,或观看官方视频:

《What’s new in the Gemini Live API》— Google for Developers,随发布一同上线。来源:YouTube

两个模型都源自 Gemini 3 Pro,文档记载的知识截止时间为 2025 年 1 月,所有生成音频带 SynthID 水印。公告点名的集成伙伴包括 Agora、Fishjam、LiveKit、Pipecat、Vercel 与 Vision Agents——例如 Vercel 的 AI Gateway 已经以 google/gemini-3.8-livegoogle/gemini-3.8-live-extended-thinking 的别名提供这两个模型。

注意事项

所有基准数字均为厂商自报。对比配置由 Google 选定。指数本身是第三方的(Artificial Analysis),但 82.6 这一数字在撰写时未被指数维护方独立复现。

语言数量尚未定论。推文与两篇博客都说 97 种语言;Live API 文档仍写 70 种,模型索引页(最后更新 9 月 4 日)甚至没有列出 3.8 系列。在 API 参考文档更新之前,"97"应视为发布营销口径。

没有公开的数值延迟。Google 的材料只有"低延迟""近实时"的定性描述,两个 3.8 模型都没有官方毫秒级或首音频延迟数据——报道中流传的 2.98 秒属于上一代 3.1 Flash Live Preview。Live 专属的速率限制同样未公布;速率限制页(9 月 2 日更新)早于本次发布。

选型建议

选 3.8 Live,如果你在做实时语音产品——客服、语音智能体、交互式助手——且 $0.005/$0.018 的每分钟价格加上打断、视觉上下文、异步函数调用已覆盖你的闭环。它是高并发对话流量的默认之选。

选 Extended Thinking,如果你的语音智能体需要在对话中做事:查记录、调 API、规划多步骤工作——而且用户应该听到"它正在干活"而不是静默。要为它的推理消耗的额外输出 token 做预算,并把客户端设计成围绕 interaction_status 而不是 turnComplete

暂缓,如果你的部署目标是 Vertex AI 且今天就需要文档化的 Cloud 支持——这两个模型的 Vertex 文档尚无法访问。另外,如果你的 Live 会话依赖情感对话或阻塞式工具,这一代已将其移除;切换模型字符串前先做好迁移规划。

常见问题

什么是 Gemini 3.8 Live?

Google 于 2026 年 9 月 15 日发布的实时音频模型,面向低延迟语音对话,支持句中打断、对话中语言切换与视觉上下文理解。它驱动 Search Live,并以 public preview 形式登陆 Gemini API。

3.8 Live 和 3.8 Live Extended Thinking 有什么区别?

它们是两个独立模型。3.8 Live 面向规模、速度与成本。Extended Thinking 边推理边说话——在多步骤任务中播报进展,并暴露 interaction_status 信号让客户端知道它何时真正空闲。Extended Thinking 还驱动 Gemini 应用中的 Gemini Live 与 Workspace 语音功能(Docs、Gmail、Keep)。

Gemini 3.8 Live 的价格是多少?

两个 3.8 模型共享同一价格行:付费层音频输入每分钟 $0.005、输出每分钟 $0.018(分别为每百万 token $3.00 与 $12.00)。文本输入 $0.75/百万 token,输出 $4.50/百万 token。存在免费层,速率限制未公布,且数据会被用于改进 Google 产品。

API 模型 ID 是什么?

gemini-3.8-livegemini-3.8-live-extended-thinking(线上形式 models/gemini-3.8-live)。Vercel 的 AI Gateway 以 google/ 前缀提供别名。它们取代的前代是 gemini-3.1-flash-live-preview

支持多少种语言?

Google 发布材料称 97 种语言、支持对话中自动切换。Live API 文档仍写 70 种——这是一个文档滞后导致的差异,在 API 参考更新前值得注明。

Extended Thinking 是模式还是独立模型?

独立模型、独立端点。向普通 3.8 Live 发送 thinking_level 会报错;Extended Thinking 上用 thinking_level 的 low、medium、high 控制推理深度。

来源

核对时间:2026 年 9 月 15 日。

延伸阅读:Gemini 3.8 Flash 完整指南