Google 于 2026 年 9 月 15 日发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking——其最先进的实时音频模型,同日在 Gemini API 正式可用(GA)。3.8 Live 主打规模、速度与成本:音频输入每分钟 $0.005、输出每分钟 $0.018。Extended Thinking 是独立模型,可以边推理边说话,在处理多步骤任务时同步播报进展而不中断对话。两者在文档中均为 Stable 状态,输入窗口 131,072 token、输出 65,536 token。
本指南基于 Google 官方公告、开发者博客、Gemini API 模型页、官方更新日志与 DeepMind 模型卡,核对时间为发布当天(2026 年 9 月 15 日)。
Google 发布了什么
@GoogleAI 的发布推文将这一对模型定位为"迄今最先进的 Gemini 音频模型":可以与之对话、协作,并把任务交给它。Google 主账号则强调生产化定位——"自然的、可用于生产环境的语音应用"。
Introducing our most advanced Gemini Audio models yet. Gemini 3.8 Live and 3.8 Live Extended Thinking let you speak, collaborate, and execute tasks seamlessly.
— @GoogleAI 2026 年 9 月 15 日
线程第二条推文给出了可用性矩阵——两个模型的发布范围并不相同。三条独立的第一方信息源(推文、两篇博客、API 更新日志 9 月 15 日条目)对发布日期与模型 ID 完全一致。
Availability: Gemini 3.8 Live in Search Live and public preview in the Gemini API; 3.8 Live Extended Thinking in Gemini Live, Workspace, and the Gemini API.
— @GoogleAI 2026 年 9 月 15 日
两个模型、两种定位
Gemini 3.8 Live 是低延迟主力:Google 的定位是"面向规模、速度与成本效率"。它支持句中打断、对话中实时切换语言(Google 发布材料称 97 种;详见下文争议点),并理解视觉上下文——在 Search Live 中把摄像头对准断掉的自行车链或漏水的水管,它会一步步给出语音指引。
Gemini 3.8 Live Extended Thinking 是拥有独立端点的另一个模型,而不是 3.8 Live 上的开关。它边推理边说话:在处理"策划一场活动"这类多步骤请求时,用简短的对话式填充句同步播报进展,让线路永远不冷场。API 协议把这一点显式化——客户端需要跟踪 interaction_status 信号(IN_PROGRESS 或 IDLE),而不是把"静默"理解为"完成"。推理深度通过 thinking_config.thinking_level 设为 low、medium 或 high。
记忆方式:3.8 Live 立刻回答你;Extended Thinking 当着你的面干活。值得注意的是,普通 3.8 Live 会直接拒绝 thinking_level 参数——想要思考能力,必须切换模型 ID。
基准速览
Google 的公告以 Extended Thinking 在第三方 Artificial Analysis 语音对语音质量指数上的领先成绩开场。以下全部为 Google 自报数据;指数方法论属于 Artificial Analysis,对比配置由 Google 选定。
| 评测 | 3.8 Live Extended Thinking | GPT-Live-1 Astra (Medium) | Grok Voice Think Fast 2.0 (High) |
|---|---|---|---|
| AA 语音对语音质量指数 | 82.6(Google 自报第一) | 81.5 | 81.3 |
| τ-Voice(语音智能体) | 68.6% | 67.9% | 56.5% |
| Sierra τ³-Voice-Banking | 35.1% | 32.0% | 16.5% |
| Big Bench Audio | 97.7% | — | — |
需要诚实解读两点。第一,Speech Agent Arena 榜单上是普通 3.8 Live:Google 报告它位居第二(媒体报道其指数约 76.0%,每小时的输入音频成本约 $0.84,Extended Thinking 约 $3.50)。第二,Extended Thinking 的 82.6 相比 2026 年 6 月同一指数的状态(GPT-Realtime-2 以 77.2% 领跑,上一代 Gemini 3.1 Flash Live Preview 为 69.5%)是一次大幅跃升。以上均为 Google 自报,独立验证要等指数维护方发布。
定价与上下文
两个 3.8 模型在官方定价页共享同一行——Google 的价目表没有为 Extended Thinking 收取溢价。下表的按分钟计价与开发者博客脚注完全一致。
| 计费项 | 免费层 | 付费层 |
|---|---|---|
| 输入 — 音频 | 免费 | $3.00 / 百万 token,或 $0.005 / 分钟 |
| 输入 — 文本 | 免费 | $0.75 / 百万 token |
| 输入 — 图片/视频 | 免费 | $1.00 / 百万 token,或 $0.002 / 分钟 |
| 输出(含思考 token)— 音频 | 免费 | $12.00 / 百万 token,或 $0.018 / 分钟 |
| 输出 — 文本 | 免费 | $4.50 / 百万 token |
| Google 搜索接地 | — | 所有 Gemini 3.x 共享每月 5,000 次免费请求,之后 $14 / 1,000 次 |
规模感参考:付费层上一次两分钟的语音对话(正常轮替)输入成本约 1 美分、输出不足 4 美分。免费层数据会被"用于改进产品",生产流量应走付费层。注意思考 token 按输出计费——Extended Thinking 的并行推理即使在不说话时也在消耗输出 token。
各平台可用性
发布范围切分得很干净,混淆两个清单是早期报道最常见的错误。DeepMind 模型卡为两个模型分别列出了分发渠道:
| 平台 | 3.8 Live | 3.8 Live Extended Thinking |
|---|---|---|
| Gemini API + AI Studio | 是(推文称 public preview;文档称 Stable/GA) | 是(同左) |
| Search Live(消费者) | 是 — 摄像头 + 语音分步指引 | 未列出 |
| Gemini 应用(Gemini Live) | 未列出 | 是 |
| Workspace:Docs Live | 未列出 | 是 — Google AI Pro/Ultra |
| Workspace:Gmail + Keep Live | 未列出 | 是 — 所有 Google AI 订阅用户 |
| Gemini Enterprise | 私测 | 私测 |
| Google Cloud / Vertex AI | 模型卡声称支持 | 模型卡声称支持 |
成熟度说明值得原样引用:发布推文称 Gemini API 上是"public preview",而 9 月 15 日的 API 更新日志写的是"generally available (GA)",两个模型页也标注 Stable。Live API 界面本身在文档中仍带 Preview 横幅。准确的表述是:模型 ID 为 Stable/GA,承载它们的 Live API 界面仍在预览阶段。Vertex AI 可用性是模型卡的声明,但发布时 Vertex 文档页仍返回 404——Cloud 可用性应视为"已宣布、文档未落地"。
Extended Thinking 协议
真正新的工程面在于 Extended Thinking 如何传递状态。在以前的 Live 模型上,turnComplete 事件意味着模型空闲、可以安全地发送下一轮输入。在 Extended Thinking 上这个假设不再成立:模型可以在说完一轮之后继续工作——调用工具、推理——然后再开口。客户端必须改为跟踪 interaction_status:IN_PROGRESS 表示推理或工具调用仍在进行,IDLE 才表示模型真正准备好接收输入。
另外两个契约变化对开发者很重要。Extended Thinking 上的工具必须声明为 NON_BLOCKING——阻塞式声明会直接报错,因为冻结会话的工具调用与"边说边干"的设计相矛盾。模型还会使用"对话填充句"——比如"我看一下"之类的短句——在工作时保持对话不断线,这正是 interaction_status 机制的用户侧呈现。
从 3.1 Flash Live 迁移
官方迁移章节列出了把 gemini-3.1-flash-live-preview 换成 gemini-3.8-live 时会破坏的东西,完整清单:
- 模型字符串:WebSocket setup 消息中使用
models/gemini-3.8-live。 - 3.8 Live 不支持
thinking_level:会话配置中直接省略thinking_level/thinking_config——该模型不支持(Extended Thinking 接受low/medium/high,不接受MINIMAL)。 - 异步函数调用成为默认:
behavior: NON_BLOCKING。阻塞模式仍可通过behavior: BLOCKING兼容;函数调度(SILENT、WHEN_IDLE、INTERRUPTED)在 3.8 Live 上支持,Extended Thinking 上不支持。 send_client_content全会话可用并支持显式角色,取代 3.1 的初始历史注入;turn_complete: true现在会无条件打断正在进行的生成。- 主动音频永久开启:设为
false会报错。 - 情感对话已移除:删除
enable_affective_dialog。 - 轮次覆盖默认值变更为包含所有视频帧——需要控制上下文与成本时要显式控制帧。
- 音频是唯一支持的输出模态:需要文本转录时要开启输出音频转录。
快速开始
Live API 是有状态的 WebSocket 会话:音频输入为 16 kHz 原始 PCM,输出为 24 kHz PCM,视频为不超过 1 FPS 的 JPEG 帧。最小 setup 消息只含模型字符串;语音、工具、VAD 灵敏度与转录开关都挂在会话配置上。Google 推荐的生产路径是:客户端直连场景使用 ephemeral token 而非裸 API key。
// WebSocket setup 消息(最小)
{
"setup": {
"model": "models/gemini-3.8-live",
"response_modalities": ["AUDIO"]
}
}
// Extended Thinking:独立模型 ID + 思考级别
{
"setup": {
"model": "models/gemini-3.8-live-extended-thinking",
"response_modalities": ["AUDIO"],
"thinking_config": { "thinking_level": "medium" }
}
}最快的上手路径:在 AI Studio 里直接体验(ai.studio/live,选择 "Stream"),克隆 Google 的 Live API 示例仓库,或观看官方视频:
两个模型都源自 Gemini 3 Pro,文档记载的知识截止时间为 2025 年 1 月,所有生成音频带 SynthID 水印。公告点名的集成伙伴包括 Agora、Fishjam、LiveKit、Pipecat、Vercel 与 Vision Agents——例如 Vercel 的 AI Gateway 已经以 google/gemini-3.8-live 与 google/gemini-3.8-live-extended-thinking 的别名提供这两个模型。
注意事项
所有基准数字均为厂商自报。对比配置由 Google 选定。指数本身是第三方的(Artificial Analysis),但 82.6 这一数字在撰写时未被指数维护方独立复现。
语言数量尚未定论。推文与两篇博客都说 97 种语言;Live API 文档仍写 70 种,模型索引页(最后更新 9 月 4 日)甚至没有列出 3.8 系列。在 API 参考文档更新之前,"97"应视为发布营销口径。
没有公开的数值延迟。Google 的材料只有"低延迟""近实时"的定性描述,两个 3.8 模型都没有官方毫秒级或首音频延迟数据——报道中流传的 2.98 秒属于上一代 3.1 Flash Live Preview。Live 专属的速率限制同样未公布;速率限制页(9 月 2 日更新)早于本次发布。
选型建议
选 3.8 Live,如果你在做实时语音产品——客服、语音智能体、交互式助手——且 $0.005/$0.018 的每分钟价格加上打断、视觉上下文、异步函数调用已覆盖你的闭环。它是高并发对话流量的默认之选。
选 Extended Thinking,如果你的语音智能体需要在对话中做事:查记录、调 API、规划多步骤工作——而且用户应该听到"它正在干活"而不是静默。要为它的推理消耗的额外输出 token 做预算,并把客户端设计成围绕 interaction_status 而不是 turnComplete。
暂缓,如果你的部署目标是 Vertex AI 且今天就需要文档化的 Cloud 支持——这两个模型的 Vertex 文档尚无法访问。另外,如果你的 Live 会话依赖情感对话或阻塞式工具,这一代已将其移除;切换模型字符串前先做好迁移规划。
常见问题
什么是 Gemini 3.8 Live?
Google 于 2026 年 9 月 15 日发布的实时音频模型,面向低延迟语音对话,支持句中打断、对话中语言切换与视觉上下文理解。它驱动 Search Live,并以 public preview 形式登陆 Gemini API。
3.8 Live 和 3.8 Live Extended Thinking 有什么区别?
它们是两个独立模型。3.8 Live 面向规模、速度与成本。Extended Thinking 边推理边说话——在多步骤任务中播报进展,并暴露 interaction_status 信号让客户端知道它何时真正空闲。Extended Thinking 还驱动 Gemini 应用中的 Gemini Live 与 Workspace 语音功能(Docs、Gmail、Keep)。
Gemini 3.8 Live 的价格是多少?
两个 3.8 模型共享同一价格行:付费层音频输入每分钟 $0.005、输出每分钟 $0.018(分别为每百万 token $3.00 与 $12.00)。文本输入 $0.75/百万 token,输出 $4.50/百万 token。存在免费层,速率限制未公布,且数据会被用于改进 Google 产品。
API 模型 ID 是什么?
gemini-3.8-live 与 gemini-3.8-live-extended-thinking(线上形式 models/gemini-3.8-live)。Vercel 的 AI Gateway 以 google/ 前缀提供别名。它们取代的前代是 gemini-3.1-flash-live-preview。
支持多少种语言?
Google 发布材料称 97 种语言、支持对话中自动切换。Live API 文档仍写 70 种——这是一个文档滞后导致的差异,在 API 参考更新前值得注明。
Extended Thinking 是模式还是独立模型?
独立模型、独立端点。向普通 3.8 Live 发送 thinking_level 会报错;Extended Thinking 上用 thinking_level 的 low、medium、high 控制推理深度。
来源
核对时间:2026 年 9 月 15 日。
- Introducing Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking — Google 博客
- Build real-time voice applications with Gemini audio models — Google 开发者博客
- Gemini 3.8 Live 模型页 — ai.google.dev
- Gemini 3.8 Live Extended Thinking 模型页 — ai.google.dev
- Gemini API 定价 — ai.google.dev
- Thinking in the Live API 指南 — ai.google.dev
- Gemini 3.8 Audio 模型卡 — Google DeepMind
- @GoogleAI 发布线程(第一条) 与 可用性推文(第二条)
延伸阅读:Gemini 3.8 Flash 完整指南。


