模型发布仅官方来源

Gemini 3.8 Flash 完整指南:基准、定价与 3.8 Flash Cyber

Google 在 6 周内推出第三个 Flash 模型。本文基于发布当天(2026 年 9 月 2 日)的官方博客、模型页与发布会推文,拆解全部 14 项基准数据、限量定价、Fairwind 安全计划与 API 用法。

编辑插图:发光的蓝青色模型核心,周围环绕上升的基准柱状图与终端窗口,象征智能体编码能力的跃升。
插图:Gemini 3.8 Flash 以 Flash 级价格逼近前沿模型的智能体编码能力。

Gemini 3.8 Flash 是 Google 六周内的第三个 Flash 模型:以 $0.75/百万输入 token 的价格,在长程智能体编码(DeepSWE v1.1 73.7%)、终端任务(Terminal-Bench 2.1 89.4%)与多步推理上大幅超越 3.7 Flash,并在多数基准上逼近或超越更大的前沿模型。 与之同时发布的还有面向受信任防御者的网络安全模型 Gemini 3.8 Flash Cyber。

本文 follows 发布当天的 官方发布博客DeepMind 模型页评测方法学页面,以及 Google、Google DeepMind、Sundar Pichai 与 Gemini API 负责人 Logan Kilpatrick 的发布会推文。所有数据均于 2026 年 9 月 2 日核对。

Google 发布了什么

2026 年 9 月 2 日,Google 发布两个基于同一基础智能的新模型:Gemini 3.8 Flash(面向通用智能体任务)与 Gemini 3.8 Flash Cyber(面向网络安全,经 Fairwind 计划向受信任防御者提供)。官方博客强调,两者都由“长程智能体循环”加速——模型可以多轮迭代使用工具,而非一次性作答。

Sundar Pichai 的发布推文点出了节奏本身:这是 6 周内的第三个 Flash 模型(继 8 月的 3.7 Flash 与更早的 3.6 Flash 之后)。Google 正在以远超以往的速度迭代 Flash 系列。

Google 主账号的发布推文附了官方标题图与完整技术长推文串:

Google 官方发布标题图,文字为 Introducing Gemini 3.8 Flash and 3.8 Flash Cyber,配 Gemini 四色星标。
Google 官方发布标题图。来源:Google 发布推文

官方基准测试

Google 的官方基准卡片对比了六个模型(3.8 Flash、3.7 Flash、Claude Opus 5、Claude Sonnet 5、GPT-5.6 Sol、GPT-5.6 Terra)。这是完整的 14 行数据,直接转录自官方图片:

Google 官方基准卡片:Gemini 3.8 Flash 对比 3.7 Flash、Claude Opus 5、Claude Sonnet 5、GPT-5.6 Sol 与 GPT-5.6 Terra 共 14 项基准,含输入输出定价行。
Google 官方基准卡片(含定价行与脚注)。来源:Logan Kilpatrick 发布推文
基准3.8 Flash3.7 FlashOpus 5Sonnet 5GPT-5.6 SolGPT-5.6 Terra
DeepSWE v1.1(长程软件工程)73.7%65.3%74.0%53.8%72.7%69.8%
GDPVal-AA v2(知识工作,Elo)154514821824158417101528%
Vals Finance Agent v2(金融分析)61.4%59.0%58.6%53.9%53.8%54.4%
Harvey 法律智能体基准(复杂法律工作流)10.0%8.8%6.7%5.0%2.5%0.8%
Terminal-Bench 2.1(智能体终端编码)89.4%85.8%89.1%80.4%88.8%87.4%
Terminal-Bench 4.0(通用智能体能力)19.1%11.2%51.8%12.4%37.3%23.6%
GDP.PDF(专家 PDF 文档理解)35.0%34.0%37.0%28.0%40.0%29.0%
CharXiv Reasoning(复杂图表推理,无工具)86.2%84.5%83.7%70.1%85.8%85.9%
LVBench(长视频理解)87.8% (agentic)85.4%75.4%68.5%82.1%78.9%
HLE-Verified(多学科专家推理)54.9%53.6%54.4%31.0%54.5%51.1%
OSWorld-2.0(智能体计算机操作)59.0%50.6%75.4%42.6%62.6%50.2%
BioMysteryBench(生物信息学,人类可解)88.8%87.1%90.1%87.5%79.5%83.8%
BioMysteryBench(生物信息学,高难)56.5%43.5%49.4%34.1%44.7%49.4%
LABBench2(生物学现实研究任务)86.2%82.1%84.2%80.1%82.1%81.2%

三个值得注意的信号:(1)Harvey 法律智能体基准上 3.8 Flash 以 10.0% 排名第一,是第二名 Opus 5(6.7%)的 1.5 倍;(2)Vals Finance Agent v2 同样第一(61.4%),验证了“领域智能体”叙事;(3)诚实的不对称——在 Terminal-Bench 4.0(19.1% vs Opus 5 的 51.8%)和 OSWorld-2.0(59.0% vs 75.4%)上,3.8 Flash 与 Opus 5 仍有实质差距。Flash 不等于全线旗舰。

DeepSWE v1.1 与成本效率

发布会主推的图是 DeepSWE v1.1 得分-成本散点图(数据源:Datacurve AI)。3.8 Flash 以约 74% 的得分出现在“最高效”区域,与 Claude Opus 5(74.0%)几乎同分,但成本远低于对方:

官方 DeepSWE v1.1 散点图:得分对每任务平均成本,Gemini 3.8 Flash 位于最有效率区域,约 74% 得分。
DeepSWE v1.1 得分-成本散点图,横轴为每任务平均成本(左高右零)。来源:Google DeepMind 发布推文串

在官方基准卡片中,DeepSWE v1.1 的具体数字为:3.8 Flash 73.7%、Opus 5 74.0%、GPT-5.6 Sol 72.7%、GPT-5.6 Terra 69.8%、3.7 Flash 65.3%、Claude Sonnet 5 53.8%。也就是 Flash 价格买到接近旗舰的智能体编码能力——这是本次发布最核心的商业论点。

HLE-Verified:专家推理

在多学科专家推理基准 HLE-Verified 上,官方柱状图给出的排序是:3.8 Flash 54.9% > GPT-5.6 Sol 54.5% > Opus 5 54.4% > 3.7 Flash 53.6% > GPT-5.6 Terra 51.1% > Claude Sonnet 5 31.0%。领先幅度不大(对 Opus 5 仅 +0.5 个百分点),但“Flash 价位拿下榜首”本身即是信号:

官方 HLE-Verified 柱状图:Gemini 3.8 Flash 54.9% 居首,其后为 GPT-5.6 Sol 54.5%、Opus 5 54.4%、3.7 Flash 53.6%、GPT-5.6 Terra 51.1%、Claude Sonnet 5 31.0%。
官方 HLE-Verified 对比图。来源:Google DeepMind 发布推文串

定价与限量优惠

官方基准卡片含脚注:3.7 与 3.8 Flash 的限量优惠价 2026 年 12 月 31 日到期;2027 年 1 月 1 日起按常规价 $1.50(输入)/$7.50(输出)计费。这实际上给了开发者四个月的锁价窗口:

模型输入 $/百万 token输出 $/百万 token备注
Gemini 3.8 Flash$0.75(常规 $1.50)$3.75(常规 $7.50)限量价至 2026-12-31
Gemini 3.7 Flash$0.75(常规 $1.50)$3.75(常规 $7.50)同一限量窗口
GPT-5.6 Terra$2.00$12.00官方卡片对比价
GPT-5.6 Sol$4.00$20.00官方卡片对比价
Claude Sonnet 5$2.00$10.00官方卡片对比价
Claude Opus 5$5.00$25.00官方卡片对比价

换算一下:输入价约为 Opus 5 的 1/6.7、输出价约为 1/6.7;而 DeepSWE 得分只差 0.3 个百分点。同规格对比下(deepmind.google 模型页),3.8 Flash 提供 1,048,576 token 输入上下文与 65,536 token 最大输出。

Gemini 3.8 Flash Cyber 与 Fairwind 计划

第二个发布是 Gemini 3.8 Flash Cyber——官方称之为“我们最强大的网络安全模型”,具备“前沿级漏洞检测与自动化修补”能力,通过新设立的 Fairwind 计划向受信任防御者提供 API 访问。官方明确表示:Google 从一开始就优先投资修补(防御)能力,而非漏洞利用(攻击)能力。

官方给出的三组数字:

评测方基准 / 环境结果
CollinearCWE-Bench(修补能力,外部基准)pass@1 47.2%,与领先前沿模型 47.8% 同处帕累托前沿,成本显著更低
Google Chrome 安全团队Chrome 真实漏洞正确补丁数量为“大得多的最佳商业模型”的 2.6 倍
Wiz内部渗透测试基准召回率提升 +7.5–9.7%,成本为其他前沿模型的 1/2.3–1/5.2
官方 CyberGym Pass@1 柱状图:Gemini 3.8 Flash Cyber 86.2% 居首,GPT-5.5-Cyber 85.6%、Mythos 5 83.8%、GPT-5.6 Sol 83.6%、Gemini 3.5 Flash Cyber 77.5%。
官方 CyberGym Pass@1 对比(C/C++ 漏洞发现)。方法学:deepmind.google/models/evals-methodology/gemini-3-8-flash-cyber

Google 同时宣布 3.8 Flash Cyber 已在内部用于保护 Google 自身代码,特别是 Chrome 安全团队的漏洞修补流程。Fairwind 的准入机制意味着普通开发者暂时无法直接调用该模型——它是面向安全团队的产品,与 3.8 Flash 的开放 API 形成有意区分。

API 快速上手

模型 ID 为 gemini-3.8-flash。以下为官方风格的最小调用示例(Python SDK):

from google import genai

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.8-flash",
    contents=[
        "Analyze this repository's CI failure logs and propose a fix.",
        # ...attach files / context as needed
    ],
)

print(response.text)

要点:(1)长程智能体任务是 3.8 Flash 的主场——给模型多步工具循环(代码执行、文件检索、终端),让它迭代;(2)上下文预算按 1M token 规划,但成本仍按实际用量计;(3)限量价窗口到 2026-12-31,年度合同谈判前值得把常规价($1.50/$7.50)纳入预算模型。

如何在 Gemini 阵容中选择

场景推荐理由
智能体编码、SWE 流水线、终端自动化gemini-3.8-flashDeepSWE 73.7% / Terminal-Bench 2.1 89.4%,价格为旗舰的约 1/6
法律、金融领域智能体gemini-3.8-flashHarvey 10.0% 与 Vals 61.4% 均为全场第一
长视频理解gemini-3.8-flash + agentic processingLVBench 87.8%(agentic),高于 3.7 Flash 的 85.4%
计算机操作(OSWorld 类)Opus 5 或评估后再定3.8 Flash 59.0% vs Opus 5 75.4%,差距实质存在
漏洞检测与修补3.8 Flash Cyber(Fairwind 准入)CWE-Bench 47.2% 帕累托前沿 + Chrome/Wiz 实测背书

注意事项

所有性能数字均为厂商自报。基准选择、对比模型配置(如 reasoning 档位)由 Google 决定;方法学页面提供了复现细节,但跨厂商数字仍应视为方向性参考。若要迁移生产流水线,请在自己的工作负载上跑 A/B。

限量价是营销工具。$0.75/$3.75 到 2026-12-31 截止,随后翻倍至 $1.50/$7.50。定价锁定四个月,但架构决策应按常规价做压力测试。

Flash 不等于全线旗舰。Terminal-Bench 4.0(19.1% vs 51.8%)与 OSWorld-2.0(59.0% vs 75.4%)的差距说明:需要旗舰级部署能力的任务仍应使用 Opus 5 级模型或等待 Gemini 3.8 Pro。

结论:适合谁用

用 3.8 Flash,如果你在跑智能体编码流水线、领域智能体(法律/金融)、长视频分析,且成本敏感——这是目前每美元智能体能力最优的选项之一。

观望,如果你的负载集中在计算机操作类任务(OSWorld 差距 16 个百分点),或需要 2027 年后的可预测成本结构——等限量窗口结束后的实际账单再定。

申请 Fairwind,如果你是安全团队且修补流水线是刚需——Chrome 2.6× 与 Wiz +7.5–9.7% 的内部实测是目前最有说服力的安全智能体证据。

常见问题

Gemini 3.8 Flash 的定价是多少?

限量优惠价为输入 $0.75/百万 token、输出 $3.75/百万 token,2026 年 12 月 31 日截止;2027 年 1 月 1 日起恢复常规价 $1.50/$7.50。Gemini 3.8 Flash Cyber 通过 Fairwind 计划按案例定价。

Gemini 3.8 Flash 与 3.7 Flash 相比有哪些提升?

DeepSWE v1.1 从 65.3% 升至 73.7%,Terminal-Bench 2.1 从 85.8% 升至 89.4%,Harvey 法律智能体基准从 8.8% 升至 10.0%,HLE-Verified 从 53.6% 升至 54.9%,LVBench(agentic)达 87.8%。核心收益集中在长程智能体任务与多步推理。

什么是 Fairwind 计划?

Fairwind 是 Google 面向受信任防御者的准入计划,通过该计划提供 Gemini 3.8 Flash Cyber 的 API 访问,用于漏洞检测与自动化修补。Google 表示优先投资防御能力(修补)而非攻击能力(漏洞利用)。

3.8 Flash Cyber 的实际安全效果如何?

官方数据:Collinear 运行的 CWE-Bench 修补基准上 pass@1 为 47.2%,与领先前沿模型的 47.8% 同处帕累托前沿且成本显著更低;Chrome 安全团队实测正确补丁数量为大型商业模型的 2.6 倍;Wiz 内部渗透测试基准上召回率提升 7.5-9.7%,成本为其他前沿模型的 1/2.3 至 1/5.2。

上下文窗口和输出长度是多少?

根据 deepmind.google 模型页:Gemini 3.8 Flash 输入上下文 1,048,576 token,最大输出 65,536 token。

应该用 3.8 Flash 还是更大的模型?

3.8 Flash 在 73.7% 的价格档位上接近 Opus 5 的 DeepSWE 成绩(74.0%),性价比突出;但在 Terminal-Bench 4.0(19.1% vs 51.8%)和 OSWorld-2.0(59.0% vs 75.4%)上与 Opus 5 仍有明显差距。重部署任务仍需旗舰级模型。

官方来源

仅官方来源,核对于 2026 年 9 月 2 日:

延伸阅读:Gemini 智能体视频理解完整指南Gemini Omni 完全指南,以及 Gemini 3.7 Flash 指南