Gemini 3.8 Flash 是 Google 六周内的第三个 Flash 模型:以 $0.75/百万输入 token 的价格,在长程智能体编码(DeepSWE v1.1 73.7%)、终端任务(Terminal-Bench 2.1 89.4%)与多步推理上大幅超越 3.7 Flash,并在多数基准上逼近或超越更大的前沿模型。 与之同时发布的还有面向受信任防御者的网络安全模型 Gemini 3.8 Flash Cyber。
本文 follows 发布当天的 官方发布博客、DeepMind 模型页、评测方法学页面,以及 Google、Google DeepMind、Sundar Pichai 与 Gemini API 负责人 Logan Kilpatrick 的发布会推文。所有数据均于 2026 年 9 月 2 日核对。
Google 发布了什么
2026 年 9 月 2 日,Google 发布两个基于同一基础智能的新模型:Gemini 3.8 Flash(面向通用智能体任务)与 Gemini 3.8 Flash Cyber(面向网络安全,经 Fairwind 计划向受信任防御者提供)。官方博客强调,两者都由“长程智能体循环”加速——模型可以多轮迭代使用工具,而非一次性作答。
两个新的 Gemini 模型来了,帮助扩展你的 AI 智能体并保护代码安全:3.8 Flash(迄今最智能的模型,软件工程、智能体任务与多步推理全面超越 3.7 Flash)与 3.8 Flash Cyber(最强大的网络安全模型,前沿级漏洞检测与自动化修补)。
— @GoogleDeepMind 2026 年 9 月 2 日
Sundar Pichai 的发布推文点出了节奏本身:这是 6 周内的第三个 Flash 模型(继 8 月的 3.7 Flash 与更早的 3.6 Flash 之后)。Google 正在以远超以往的速度迭代 Flash 系列。
今天我们推出新的 3.8 Flash 模型,6 周内第三个 Flash 版本。它在软件工程、智能体任务与多步推理上较 3.7 Flash 显著跃升:在 DeepSWE v1.1 上,它以极低的成本超越多数更大的前沿模型,端到端自主解决复杂工程问题。
— @sundarpichai 2026 年 9 月 2 日
Google 主账号的发布推文附了官方标题图与完整技术长推文串:
Gemini 3.8 来了,这是我们迄今最强的推理与编码模型。借助长程智能体循环,在仅仅三周前 3.7 Flash 的势头之上,我们一次性发布两个 3.8 变体:Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。
— @Google 2026 年 9 月 2 日
官方基准测试
Google 的官方基准卡片对比了六个模型(3.8 Flash、3.7 Flash、Claude Opus 5、Claude Sonnet 5、GPT-5.6 Sol、GPT-5.6 Terra)。这是完整的 14 行数据,直接转录自官方图片:
| 基准 | 3.8 Flash | 3.7 Flash | Opus 5 | Sonnet 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|---|---|---|
| DeepSWE v1.1(长程软件工程) | 73.7% | 65.3% | 74.0% | 53.8% | 72.7% | 69.8% |
| GDPVal-AA v2(知识工作,Elo) | 1545 | 1482 | 1824 | 1584 | 1710 | 1528% |
| Vals Finance Agent v2(金融分析) | 61.4% | 59.0% | 58.6% | 53.9% | 53.8% | 54.4% |
| Harvey 法律智能体基准(复杂法律工作流) | 10.0% | 8.8% | 6.7% | 5.0% | 2.5% | 0.8% |
| Terminal-Bench 2.1(智能体终端编码) | 89.4% | 85.8% | 89.1% | 80.4% | 88.8% | 87.4% |
| Terminal-Bench 4.0(通用智能体能力) | 19.1% | 11.2% | 51.8% | 12.4% | 37.3% | 23.6% |
| GDP.PDF(专家 PDF 文档理解) | 35.0% | 34.0% | 37.0% | 28.0% | 40.0% | 29.0% |
| CharXiv Reasoning(复杂图表推理,无工具) | 86.2% | 84.5% | 83.7% | 70.1% | 85.8% | 85.9% |
| LVBench(长视频理解) | 87.8% (agentic) | 85.4% | 75.4% | 68.5% | 82.1% | 78.9% |
| HLE-Verified(多学科专家推理) | 54.9% | 53.6% | 54.4% | 31.0% | 54.5% | 51.1% |
| OSWorld-2.0(智能体计算机操作) | 59.0% | 50.6% | 75.4% | 42.6% | 62.6% | 50.2% |
| BioMysteryBench(生物信息学,人类可解) | 88.8% | 87.1% | 90.1% | 87.5% | 79.5% | 83.8% |
| BioMysteryBench(生物信息学,高难) | 56.5% | 43.5% | 49.4% | 34.1% | 44.7% | 49.4% |
| LABBench2(生物学现实研究任务) | 86.2% | 82.1% | 84.2% | 80.1% | 82.1% | 81.2% |
三个值得注意的信号:(1)Harvey 法律智能体基准上 3.8 Flash 以 10.0% 排名第一,是第二名 Opus 5(6.7%)的 1.5 倍;(2)Vals Finance Agent v2 同样第一(61.4%),验证了“领域智能体”叙事;(3)诚实的不对称——在 Terminal-Bench 4.0(19.1% vs Opus 5 的 51.8%)和 OSWorld-2.0(59.0% vs 75.4%)上,3.8 Flash 与 Opus 5 仍有实质差距。Flash 不等于全线旗舰。
DeepSWE v1.1 与成本效率
发布会主推的图是 DeepSWE v1.1 得分-成本散点图(数据源:Datacurve AI)。3.8 Flash 以约 74% 的得分出现在“最高效”区域,与 Claude Opus 5(74.0%)几乎同分,但成本远低于对方:
在官方基准卡片中,DeepSWE v1.1 的具体数字为:3.8 Flash 73.7%、Opus 5 74.0%、GPT-5.6 Sol 72.7%、GPT-5.6 Terra 69.8%、3.7 Flash 65.3%、Claude Sonnet 5 53.8%。也就是 Flash 价格买到接近旗舰的智能体编码能力——这是本次发布最核心的商业论点。
HLE-Verified:专家推理
在多学科专家推理基准 HLE-Verified 上,官方柱状图给出的排序是:3.8 Flash 54.9% > GPT-5.6 Sol 54.5% > Opus 5 54.4% > 3.7 Flash 53.6% > GPT-5.6 Terra 51.1% > Claude Sonnet 5 31.0%。领先幅度不大(对 Opus 5 仅 +0.5 个百分点),但“Flash 价位拿下榜首”本身即是信号:
定价与限量优惠
官方基准卡片含脚注:3.7 与 3.8 Flash 的限量优惠价 2026 年 12 月 31 日到期;2027 年 1 月 1 日起按常规价 $1.50(输入)/$7.50(输出)计费。这实际上给了开发者四个月的锁价窗口:
| 模型 | 输入 $/百万 token | 输出 $/百万 token | 备注 |
|---|---|---|---|
| Gemini 3.8 Flash | $0.75(常规 $1.50) | $3.75(常规 $7.50) | 限量价至 2026-12-31 |
| Gemini 3.7 Flash | $0.75(常规 $1.50) | $3.75(常规 $7.50) | 同一限量窗口 |
| GPT-5.6 Terra | $2.00 | $12.00 | 官方卡片对比价 |
| GPT-5.6 Sol | $4.00 | $20.00 | 官方卡片对比价 |
| Claude Sonnet 5 | $2.00 | $10.00 | 官方卡片对比价 |
| Claude Opus 5 | $5.00 | $25.00 | 官方卡片对比价 |
换算一下:输入价约为 Opus 5 的 1/6.7、输出价约为 1/6.7;而 DeepSWE 得分只差 0.3 个百分点。同规格对比下(deepmind.google 模型页),3.8 Flash 提供 1,048,576 token 输入上下文与 65,536 token 最大输出。
Gemini 3.8 Flash Cyber 与 Fairwind 计划
第二个发布是 Gemini 3.8 Flash Cyber——官方称之为“我们最强大的网络安全模型”,具备“前沿级漏洞检测与自动化修补”能力,通过新设立的 Fairwind 计划向受信任防御者提供 API 访问。官方明确表示:Google 从一开始就优先投资修补(防御)能力,而非漏洞利用(攻击)能力。
官方给出的三组数字:
| 评测方 | 基准 / 环境 | 结果 |
|---|---|---|
| Collinear | CWE-Bench(修补能力,外部基准) | pass@1 47.2%,与领先前沿模型 47.8% 同处帕累托前沿,成本显著更低 |
| Google Chrome 安全团队 | Chrome 真实漏洞 | 正确补丁数量为“大得多的最佳商业模型”的 2.6 倍 |
| Wiz | 内部渗透测试基准 | 召回率提升 +7.5–9.7%,成本为其他前沿模型的 1/2.3–1/5.2 |
Google 同时宣布 3.8 Flash Cyber 已在内部用于保护 Google 自身代码,特别是 Chrome 安全团队的漏洞修补流程。Fairwind 的准入机制意味着普通开发者暂时无法直接调用该模型——它是面向安全团队的产品,与 3.8 Flash 的开放 API 形成有意区分。
API 快速上手
模型 ID 为 gemini-3.8-flash。以下为官方风格的最小调用示例(Python SDK):
from google import genai
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.8-flash",
contents=[
"Analyze this repository's CI failure logs and propose a fix.",
# ...attach files / context as needed
],
)
print(response.text)要点:(1)长程智能体任务是 3.8 Flash 的主场——给模型多步工具循环(代码执行、文件检索、终端),让它迭代;(2)上下文预算按 1M token 规划,但成本仍按实际用量计;(3)限量价窗口到 2026-12-31,年度合同谈判前值得把常规价($1.50/$7.50)纳入预算模型。
如何在 Gemini 阵容中选择
| 场景 | 推荐 | 理由 |
|---|---|---|
| 智能体编码、SWE 流水线、终端自动化 | gemini-3.8-flash | DeepSWE 73.7% / Terminal-Bench 2.1 89.4%,价格为旗舰的约 1/6 |
| 法律、金融领域智能体 | gemini-3.8-flash | Harvey 10.0% 与 Vals 61.4% 均为全场第一 |
| 长视频理解 | gemini-3.8-flash + agentic processing | LVBench 87.8%(agentic),高于 3.7 Flash 的 85.4% |
| 计算机操作(OSWorld 类) | Opus 5 或评估后再定 | 3.8 Flash 59.0% vs Opus 5 75.4%,差距实质存在 |
| 漏洞检测与修补 | 3.8 Flash Cyber(Fairwind 准入) | CWE-Bench 47.2% 帕累托前沿 + Chrome/Wiz 实测背书 |
注意事项
所有性能数字均为厂商自报。基准选择、对比模型配置(如 reasoning 档位)由 Google 决定;方法学页面提供了复现细节,但跨厂商数字仍应视为方向性参考。若要迁移生产流水线,请在自己的工作负载上跑 A/B。
限量价是营销工具。$0.75/$3.75 到 2026-12-31 截止,随后翻倍至 $1.50/$7.50。定价锁定四个月,但架构决策应按常规价做压力测试。
Flash 不等于全线旗舰。Terminal-Bench 4.0(19.1% vs 51.8%)与 OSWorld-2.0(59.0% vs 75.4%)的差距说明:需要旗舰级部署能力的任务仍应使用 Opus 5 级模型或等待 Gemini 3.8 Pro。
结论:适合谁用
用 3.8 Flash,如果你在跑智能体编码流水线、领域智能体(法律/金融)、长视频分析,且成本敏感——这是目前每美元智能体能力最优的选项之一。
观望,如果你的负载集中在计算机操作类任务(OSWorld 差距 16 个百分点),或需要 2027 年后的可预测成本结构——等限量窗口结束后的实际账单再定。
申请 Fairwind,如果你是安全团队且修补流水线是刚需——Chrome 2.6× 与 Wiz +7.5–9.7% 的内部实测是目前最有说服力的安全智能体证据。
常见问题
Gemini 3.8 Flash 的定价是多少?
限量优惠价为输入 $0.75/百万 token、输出 $3.75/百万 token,2026 年 12 月 31 日截止;2027 年 1 月 1 日起恢复常规价 $1.50/$7.50。Gemini 3.8 Flash Cyber 通过 Fairwind 计划按案例定价。
Gemini 3.8 Flash 与 3.7 Flash 相比有哪些提升?
DeepSWE v1.1 从 65.3% 升至 73.7%,Terminal-Bench 2.1 从 85.8% 升至 89.4%,Harvey 法律智能体基准从 8.8% 升至 10.0%,HLE-Verified 从 53.6% 升至 54.9%,LVBench(agentic)达 87.8%。核心收益集中在长程智能体任务与多步推理。
什么是 Fairwind 计划?
Fairwind 是 Google 面向受信任防御者的准入计划,通过该计划提供 Gemini 3.8 Flash Cyber 的 API 访问,用于漏洞检测与自动化修补。Google 表示优先投资防御能力(修补)而非攻击能力(漏洞利用)。
3.8 Flash Cyber 的实际安全效果如何?
官方数据:Collinear 运行的 CWE-Bench 修补基准上 pass@1 为 47.2%,与领先前沿模型的 47.8% 同处帕累托前沿且成本显著更低;Chrome 安全团队实测正确补丁数量为大型商业模型的 2.6 倍;Wiz 内部渗透测试基准上召回率提升 7.5-9.7%,成本为其他前沿模型的 1/2.3 至 1/5.2。
上下文窗口和输出长度是多少?
根据 deepmind.google 模型页:Gemini 3.8 Flash 输入上下文 1,048,576 token,最大输出 65,536 token。
应该用 3.8 Flash 还是更大的模型?
3.8 Flash 在 73.7% 的价格档位上接近 Opus 5 的 DeepSWE 成绩(74.0%),性价比突出;但在 Terminal-Bench 4.0(19.1% vs 51.8%)和 OSWorld-2.0(59.0% vs 75.4%)上与 Opus 5 仍有明显差距。重部署任务仍需旗舰级模型。
官方来源
仅官方来源,核对于 2026 年 9 月 2 日:
- Introducing Gemini 3.8 Flash and 3.8 Flash Cyber — Google 官方博客
- Gemini 3.8 Flash 模型页 — Google DeepMind
- 评测方法学:Gemini 3.8 Flash — Google DeepMind
- 评测方法学:Gemini 3.8 Flash Cyber — Google DeepMind
- Google DeepMind 发布推文串(官方图表)
- Google 发布推文串(标题图与技术细节)
- Sundar Pichai 发布推文
- Logan Kilpatrick(Gemini API 负责人)发布推文与基准卡片
延伸阅读:Gemini 智能体视频理解完整指南、Gemini Omni 完全指南,以及 Gemini 3.7 Flash 指南。





