模型发布

Gemini 4 Argon:基准测试、定价与使用资格完整指南

Google DeepMind 的新前沿模型带来 1M token 输出上限、明确偏向网络安全防御的定位,以及从可信测试者而非公共 API 起步的开放路径。本文给出全部官方基准表、引入期定价、Google 内部实践案例,以及开发者接口面中仍然缺失的部分。

发光模型核心释放出极长的 token 光带并溢出敞开输出窗口的编辑插画,旁边是半透明盾牌扫描代码仓库柱状块。
示意图:输出预算足以溢出单个窗口的前沿模型核心,以及 Google 主打的网络安全扫描意象。

Google DeepMind 于 2026 年 9 月 30 日发布 Gemini 4 Argon — 定位为前沿模型,面向编码、企业知识工作与网络安全防御中的复杂工作流,并通过 Google 的 Fairwind Program 面向有限数量的可信测试者开放。 最受关注的技术指标是 100 万 token 的输出上限,Google 称其为业界领先,相比此前 Gemini 各版本的 64K 输出上限是一次大幅提升。Google 同时公布了引入期按 token 计费的价格,但截至发布当日,尚未把 Argon 加入公开的 Gemini API 模型列表与定价表。

本文只使用一手来源:Google 官方公告(作者为 Koray Kavukcuoglu)、DeepMind Fairwind Program 页面、2026 年 9 月 2 日的Fairwind 发布博文、Gemini API 现行的模型文档与定价页面、DeepMind 的模型卡索引与前沿安全框架页面,以及 Google 官方账号在 X 上的发布帖。以下所有数据均核对于 2026 年 9 月 30 日,即发布当天。

Google 发布了什么

首发公告来自 Google DeepMind 官方账号,将 Argon 定义为前沿模型,而不是既有档位的升级。公告列出的目标负载 — 编码、企业知识工作与网络安全防御中的复杂工作流 — 描述的是长时间运行的智能体任务,而非对话。与常规 Gemini 发布差异最大的是分发方式:首发当天面向一批可信测试者,入口是 Fairwind Program。

Introducing Gemini 4 Argon – our new frontier model. It’s built for complex workflows across coding, enterprise knowledge work, and cybersecurity defense – rolling out today to a set of trusted testers through our Fairwind Program.

— @GoogleDeepMind September 30, 2026

同一账号的后续帖直接回应了输出上限,而 Sundar Pichai 的长帖则给出了 Google 希望绑定在这款模型上的叙事:Google 内部已在大规模使用,反馈来自从编码到量子计算的各个团队。

With a 1M token output limit, Argon adds a deeper level of reasoning to tackle…

— @GoogleDeepMind September 30, 2026

Google 企业账号复述了同样的三个工作负载方向,并把输出上限列为差异点。把两段文案并列看,重点完全一致:同样的三个领域、同样的 1M 数字、同样的「前沿」定位。

Today we’re introducing Gemini 4 Argon. It delivers frontier performance in complex workflows across real-world software engineering, knowledge work, and cybersecurity defense with an industry-leading 1M token output limit.

— @Google September 30, 2026

Lots of discussion out there about our next model(!), so I wanted to give an early look as soon as possible. Introducing Gemini 4 Argon! It shows frontier performance in complex workflows, cyber defense and software engineering. Teams are using it extensively at Google, from coding to quantum computing, great feedback. Here’s a look at the benchmarks:

— @sundarpichai September 30, 2026

最后那条帖子值得仔细阅读,因为它为后文设定了证据标准。Google 描述的是自家内部使用情况与自家跑的基准。Pichai 说「这里是基准测试的结果」并附上图表,这使这些图表成为本文所引述结论的原始证据 — 但它们始终是厂商自测结果,而非独立评测。

Gemini 4 Argon 官方主视觉:深蓝渐变背景前一枚风格化的蓝色数字四。
随公告发布的官方主视觉。来源:Google 官方博客

1M token 输出上限

输出上限是悄悄塑造智能体架构的约束。当模型一次响应最多只能输出 64K token 时,长周期任务必须被切分为多步,状态要在多次调用之间传递,编排层承担把结果重新拼接起来的负担。把上限提高到 100 万 token 改变了这份负担的位置 — 原先需要循环完成的工作,现在可以由一次生成承载。

以下是 Google 官方渠道给出的对比数据:

规格Gemini 4 Argon上一代 Gemini
输出 token 上限1,000,000 token64K token(此前 Gemini 各版本)
Google 的表述「业界领先的 1M token 输出上限」—
宣称的推理效果「加入更深层次的推理以应对」复杂任务—
公开 API 模型 ID未出现在 Gemini API 模型列表中—
独立验证一手来源中未发现—

这张表需要配三点限定。第一,本文核对的一手来源均未定义 1M 上限的确切语义 — 例如是否适用于流式输出、多轮续写,或按单次尝试计量。第二,Google 没有同时公布速率限制、延迟或首 token 时间。第三,由于截至 9 月 30 日 Argon 在公开 API 文档中没有模型 ID,外部开发者目前无法直接验证这一数字。

对于正在做容量规划的团队,务实的解读是:100 万输出 token 属于有限开放下宣布的能力,而不是可直接购买的档位。合理的做法是针对今天真正能调用的上限来设计,把更大的预算当作访问开放后的额外收益,而不是围绕一个尚无法测量的数字重构架构。

基准测试速览

Google 的公告在编码、通用智能体能力与长视频理解三个方面都给出了基准提升。本节所有数字都是厂商自测:对比模型由 Google 选定,评测由 Google 执行或委托执行,图表由 Google 发布。截至发布当日,在一手来源中未发现任何 Argon 数字的独立复现,这些数字也没有随附评测工具链配置或运行日志。

评测项Argon 结果Google 的表述限定条件
DeepSWE v1.1(软件工程)77.9%刷新最高水平厂商自测;工具链与配置未完整公布
Vals Index(经济影响力能力)表述为领先该指数上的前沿位置厂商自报;无独立复现的分数
AutomationBench(Zapier)51.3%排名第一厂商自测
LVBench(长视频理解)91.7%最高水平厂商自测
CWE-bench v1(安全补丁)68%并列第一三家 68% 并列;见下方图表
Gray Swan 间接提示注入鲁棒性曲线领先对比集合中最稳健攻击成功率越低越好;厂商自测

其中一行需要明确说明。CWE-bench v1 并不是干净的胜出:公开图表显示 Argon、Grok 4.7 与 GPT-6 Astra 在 68% 处三强并列。Google 标注 Argon 并列第一,这本身准确,同时也意味着该安全补丁结果并未把 Argon 与对手区分开。如果决策依赖这项基准,诚实的结论是平局,而不是领先。

同样的判断适用于整组基准。Google 选择的评测组合侧重软件工程、流程自动化、视频理解与安全,这确实是公告中三个工作负载方向的合理代理,但它不是通用能力指数;一个模型可能在这组特定评测上表现突出,同时在推理性或多语言任务上并不出众。

网络安全评测

网络安全结果是公告中图表篇幅最大的部分,这与首批开放对象是网络防御者相吻合。其中两张图表对应公开基准,另外两张对应 Google 内部或合作方执行的安全工作。

Google 官方图表:CWE-bench v1 在十一个模型上的结果,Gemini 4 Argon 与 Grok 4.7、GPT-6 Astra 在 68% 处并列。
CWE-bench v1 在对比集合上的结果。厂商自测;请注意 68% 处的三强并列。来源:Google 官方博客

CWE-bench 衡量的是模型能否修补真实存在的漏洞类别。68% 在这样一项困难的基准上是实打实的进展,而图表把并列关系直接呈现出来,没有把它埋掉 — 对需要做判断的读者而言,这正是最有用的部分。

Google 官方图表:Gray Swan 间接提示注入鲁棒性,Gemini 4 Argon 的攻击成功率最低,为 0.7%。
Gray Swan 间接提示注入鲁棒性(攻击成功率越低越好)。厂商自测。来源:Google 官方博客

Gray Swan 图表的读数方向与其他几张相反:指标是攻击成功率,因此数值越低越好。Google 报告 Argon 在 k=15 次尝试下的攻击成功率为 0.7%,是对比集合中最稳健的表现。对于任何会读取不可信内容的智能体 — 网页、工单系统、邮件 — 间接提示注入鲁棒性是为数不多可以直接量化的安全属性,因此这张图比编码分数更具决策价值。

Google 官方图表:真实漏洞发现上 Gemini 4 Argon 为 85.8%、Gemini 3.8 Flash Cyber 为 71.0%;Wiz 渗透测试基准上分别为 70.9% 与 58.2%。
真实漏洞发现与一项由合作方执行的渗透测试基准,对比对象是此前的安全专用模型。厂商自测;图表标注的合作方为 Wiz。来源:Google 官方博客
安全评测Gemini 4 ArgonGemini 3.8 Flash Cyber状态
真实漏洞发现85.8%71.0%Google 内部基准
Wiz 渗透测试基准70.9%58.2%合作方执行,由 Google 报告
CWE-bench v168%(并列第一)图表中列出公开基准,厂商自测运行
Gray Swan IPI 成功率 @ k=150.7%(最低)图表中列出公开基准,厂商自测运行

这里的对比对象很能说明问题。Google 用自家面向网络安全调优的 3.8 Flash Cyber 作为 Argon 的对比基准,而不只是与竞品比较。在漏洞发现上比内部专用模型高出约 15 个百分点,是有意义的内部进步;但它同时是内部对比,在内部基础设施上评测,未公布测试集,读者应把绝对百分比视为方向性参考。Wiz 那一行性质不同:Wiz 是外部安全厂商,基准属于它,但结果仍由 Google 报告,且在一手来源中未找到 Wiz 对同一次运行的公开说明。

Google 内部实践

Google 给出了一组内部案例,这是公告中最具辨识度的部分,因为公司对具体工作描述得相当细,而不只是宣称效率提升。这些是内部结果,没有外部测试工具链,因此它们说明的是能力方向而非能力证明 — 但细节足够具体,可以据此推理。

内部工作报告结果说明了什么
语言迁移(C/C++ 转 Rust)替换 32K 行 SIMD 代码;结果报告为比此前的 Rust 移植快 2.7 倍,并更接近优化后的 C++对性能关键代码的大规模机械式重构;「更接近」属定性表述
Fuchsia Zircon 内核迁移迁移 800K+ 行代码1M 输出预算应用于单一超大代码库任务
内存效率优化释放 300 TiB,估计可优化空间为 500 TiB 至 1 PiB基础设施规模的优化任务
量子优化比已发表的基线提升 40%研究域工作;未公布方法论
广泛内部使用据 Pichai 所述,团队「大量」使用 Argon,覆盖从编码到量子计算对外开放前的长期内部试用

迁移类数字与输出上限的关联最直接。替换 32K 行 SIMD 代码,或迁移 800K+ 行内核代码,正是 64K 输出上限会让过程很别扭、而 1M 上限能让它用更少轮次完成的典型任务。这一关联是合理机制而非证明,因为 Google 未公布这两次迁移背后的提示结构、轮次数量或评审流程。

定性措辞需要谨慎对待。「比 Rust 移植快 2.7 倍」是两个内部产物之间的相对说法,「更接近优化后的 C++」是 Google 自己的描述,而非基准结果。量子优化数字没有公布基线引用或评测协议,因此最好把它理解为 Google 在这类问题上投入方向的信号,而不是可与任何外部结果对比的性能主张。

Fairwind Program 与开放节奏

访问权限是当前最关键的限制,而它通过 Fairwind Program 而非 Gemini API 实现。Fairwind 于 2026 年 9 月 2 日作为面向防御方的项目推出;DeepMind 项目页面称其与全球合作网络协作,并报告全球 650+ 家合作方。该数字覆盖整个项目,并非专指 Argon 的使用资格。

Fairwind 项目页面还把更早的 DeepMind 安全工作与此次发布连接起来,点名 Gemini 3.8 Flash Cyber 与 CodeMender — DeepMind 于 2025 年 10 月发布的代码安全智能体。Argon 是这条线的第三步:面向网络安全的调优模型、自动修补智能体,以及如今首批开放对象为防御方的前沿模型。

阶段开放对象渠道已公布日期
一(已开始)可信测试者,Google 称其为首批网络防御者Fairwind Program2026 年 9 月 30 日
二(已宣布)付费 API 客户与 Google AI Ultra 订阅用户Gemini API、消费者订阅未公布
三(已宣布)开发者、企业与普通消费者完整接口面未公布

第二、第三阶段都没有附加日期。这对规划影响很大:如果你在等待 Gemini API 上的 Argon,目前没有已公布的时间表可供参考。有近期需求的团队应确认 API 今天实际可用的模型,而不是围绕一个未公布的日期安排计划。

定价

Google 随公告公布了引入期定价。结构是促销价格在引入期后上调,同时对缓存输入提供大幅折扣,网络安全能力不单独溢价。

计费项引入期单价引入期后的标准单价
输入每 100 万 token 2.00 美元每 100 万 token 4.00 美元
输出每 100 万 token 10.00 美元每 100 万 token 20.00 美元
缓存输入缓存部分享受 95% 折扣标准期的折扣结构未公布
网络安全能力无单独计费项无单独计费项
公开发定价页条目截至 2026 年 9 月 30 日不存在截至 2026 年 9 月 30 日不存在

三点观察。引入期的输入与输出价格在促销结束后恰好翻倍,因此任何成本模型都应基于 4 / 20 美元构建,并把当前价格视为折扣而非定价。缓存输入折扣是可用杠杆中最大的一个:对于反复发送大段稳定前缀的智能体负载,缓存输入降低 95% 会压倒表中其他所有因素。此外,由于公开的 Gemini API 定价页(最后更新于 2026 年 9 月 8 日)没有对应条目,这些价格只存在于公告文本与发布图表中,尚未进入开发者会查阅的计费文档。

举个量级感受:在长时间生成类工作中输出 token 主导成本。按每百万输出 token 10 美元计算,一次 10 万 token 的生成产物在引入期约 1 美元,之后约 2 美元。这正是让 1M 输出预算既有趣又昂贵的那笔算术 — 一次完整的 100 万 token 生成在引入期约 10 美元,标准期约 20 美元,且还未计入输入成本。

当前 API 状态

这一节是公告与开发者文档不一致的地方,也是本次发布中最关键的实务缺口。

接口面一手来源显示的内容
Gemini API 模型列表没有 Argon 模型 ID;该页最后更新于 2026 年 9 月 4 日,早于本次发布
Gemini API 定价页没有 Argon 定价条目;最后更新于 2026 年 9 月 8 日
DeepMind 模型卡索引未发布 Gemini 4 Argon 模型卡
安全文档未找到针对 Argon 的评测报告
官方演示视频在 Google 或 DeepMind 渠道上未找到
公告中的访问渠道Fairwind Program 可信测试者

这个模式是稳定的:面向市场的页面在发布当天同步更新,参考类页面尚未跟上。对有限开放的首发而言这属正常,但它有一个具体后果 — 没有公开模型 ID,外部开发者就没有可调用的对象,也没有已公布的速率限制、上下文窗口细节或区域可用性可供规划。

对封装模型调用的智能体与技能而言,这正是值得为之设计的现实情形:一款宣布了定价、但还无法寻址的新前沿模型。Gemini 3.8 Flash 指南与Gemini 3.8 Live 指南覆盖的都是已有稳定 ID 的模型,因此是本月内要上线的项目更稳妥的基础。

安全与保障

开放节奏的设定明显谨慎。访问从一小批防御者开始,这本身就是限制风险的决定:安全工作有清晰的正当用途、可衡量的结果,以及能够上报滥用的合作方。Google 的前沿安全框架页面描述了公司针对前沿模型的分阶段评估方式,公告也把该框架作为治理背景。

缺失的是针对 Argon 的具体证据。截至 2026 年 9 月 30 日,Google 尚未发布该模型的模型卡、能力阈值评估或滥用评测。读者目前无法把 Argon 与框架自身设定的阈值进行核对。诚实的总结是:Google 描述了一次负责任的渐进式开放,而让外部能够审计这一说法的那份文档尚未发布。

对智能体工作流的影响

先放下访问权限问题:Google 强调的能力指向四类如果说法成立就会变得更容易的工作流模式。

单次长生成。1M 的输出预算让「一次调用产出完整产物」变得合理 — 完整的迁移补丁集、跨文件的大型重构、生成的测试套件 — 而不必驱动由大量小改动组成的循环。代价是成本集中与评审难度:一个巨大的响应比十个小响应更难增量评审,因此工作流需要加一道验证步骤,而不是继续加提示。

具备可量化鲁棒性的安全审查。对智能体开发者而言,间接提示注入结果是本次发布中最可行动的数字。如果智能体会摄取网页、工单或邮件内容,注入鲁棒性就是活跃的威胁模型,0.7% 的攻击成功率是一个可以据以推理的数字 — 同时要记住它是在固定尝试次数下的厂商自测结果。

迁移与大型代码库工作。C/C++ 转 Rust 与 Fuchsia 的数字描述的是长周期代码变换,这正是输出上限历来迫使人们投入最多编排开销的工作负载类别。今天做这类工作的团队通常把它切分到多次调用;Argon 的定位则暗示可以合并轮次。

漏洞分类与修补。把更高的漏洞发现率与一项补丁类基准(CWE-bench)放在一起,描述的是从分类到修复的闭环。限定条件不变:两个数字都是厂商自测,且补丁结果是三强并列。

考虑到访问限制,一个务实的采纳顺序是:生产环境继续沿用当前模型 ID;今天就针对已有稳定公开 ID 的模型做原型;持续关注 Gemini API 的模型与定价页面是否出现 Argon 条目;如果你是防御方机构,把 Fairwind Program 当作入口来评估,而不是等待通用可用。如果你的工作依赖 1M 输出预算,在最终决定前先对长生成的成本做实测,因为这是定价表回报最少的一个维度。

注意事项

本文引用的所有测量结果均为厂商自报。基准由 Google 执行或委托执行,对比模型由 Google 选定,图表由 Google 发布。发布当日在一手来源中未发现任何 Argon 数字的独立复现;漏洞发现与量子优化等结果描述的是内部工作,未公布方法论。

安全基准的领先并不总是领先。CWE-bench v1 是三家在 68% 处并列。Google 使用「并列第一」的表述是准确的;把那一行当作胜出则不准确。

API 接口面尚未公布。没有模型 ID、没有定价条目、没有模型卡、没有速率限制、没有延迟数据、没有区域可用性。1M 输出上限尤其没有关于流式或多轮使用的语义说明。

上文嵌入的四条发布帖中有两条为节录。DeepMind 关于输出上限的帖子以及 Google 的衍生帖在所示开头分句之后仍有内容,完整文本可在链接的帖子中查看。本文没有对无法直接读取的文本做转述。

开放时间表未公布。从可信测试者到付费 API 客户再到通用可用的路径没有已公布的时间线,因此任何建立在 Argon 会按时进入公共 API 之上的计划都是假设。

内部结果属于例证。内存、迁移与量子相关数字说明 Google 在哪些地方使用该模型。它们无法与外部基准直接比较,而在「比 Rust 移植快 2.7 倍」这一例中,基线本身也是内部产物。

选型建议

可以使用 Argon,如果你是防御方机构或拥有 Fairwind 访问权限的合作方,且工作涉及漏洞发现、大规模安全修补或长周期代码迁移。1M 输出预算与网络安全评测表现的组合正对准这类工作,而在引入期价格下,它的定价相对其他前沿方案具有竞争力。

建议等待,如果你需要稳定的公开模型 ID、已公布的速率限制、模型卡或已记录的安全评测。Argon 目前都不具备。对于本月要上线的生产代码,有稳定 ID 的模型是更稳妥的选择,而 3.8 Flash 档位以更低的成本覆盖了大多数高并发负载。

值得持续关注,如果你的架构受输出上限影响。1M 预算是最有可能改变长周期智能体结构方式的规格,值得在 API 文档补齐时跟进 — 届时的实务问题会变成速率限制、延迟,以及缓存输入定价在标准档位是否延续。

常见问题

Gemini 4 Argon 是什么?

Google DeepMind 于 2026 年 9 月 30 日发布的前沿模型,面向编码、企业知识工作与网络安全防御中的复杂工作流。Google 称其提供前沿性能,并具备业界领先的 1M token 输出上限。

我现在可以通过 Gemini API 使用 Gemini 4 Argon 吗?

作为有文档记录的公开模型还不行。Gemini API 模型页(最后更新于 2026 年 9 月 4 日)没有 Argon 条目,定价页(最后更新于 2026 年 9 月 8 日)没有 Argon 价格行。目前的访问通过面向可信测试者的 Fairwind Program 进行。

1M token 输出上限是什么,为什么重要?

它是 Argon 单次响应可生成的最大 token 数,相比此前 Gemini 版本的 64K 上限大幅提高。更大的输出预算意味着长周期工作可以用更少的轮次完成,而不必拆分到大量调用中。Google 尚未公布该上限在流式输出或多轮续写下的确切语义,也没有公布速率限制或延迟数据。

Gemini 4 Argon 的价格是多少?

引入期价格为每 100 万输入 token 2.00 美元、每 100 万输出 token 10.00 美元,缓存输入享受 95% 折扣。引入期结束后,这两个价格翻倍至 4.00 美元与 20.00 美元。这些价格目前都未出现在公开发定价页上。

Google 公布了哪些基准结果?

DeepSWE v1.1 为 77.9%(称刷新最高水平)、AutomationBench 为 51.3%(称排名第一)、LVBench 为 91.7%、Vals Index 上处于领先位置、CWE-bench v1 为 68% 并列第一,以及 Gray Swan 间接提示注入上领先的鲁棒性表现。全部为厂商自报,无独立复现。

CWE-bench 的结果算是胜出吗?

不算 — 是 Argon、Grok 4.7 与 GPT-6 Astra 在 68% 处的三强并列。Google 标注 Argon 并列第一,这准确,但这项基准并未把 Argon 与对手区分开。

Fairwind Program 是什么?

Google 于 2026 年 9 月 2 日推出的面向防御方的项目,也是 Argon 首批开放对象的访问路径。DeepMind 项目页面报告全球 650+ 家合作方,并点名了更早的 DeepMind 安全工作,包括 Gemini 3.8 Flash Cyber 与 CodeMender 修补智能体。

Argon 什么时候通用可用?

Google 公布了开放顺序 — 可信测试者,然后是付费 API 客户与 Google AI Ultra 订阅用户,再到开发者、企业与消费者 — 但没有公布后续阶段的任何日期。

Google 内部用 Argon 做了什么?

报告的内部工作包括:C/C++ 转 Rust 的迁移替换了 32K 行 SIMD 代码;Fuchsia Zircon 内核迁移超过 800K 行;内存优化释放 300 TiB,估计可优化空间为 500 TiB 至 1 PiB;量子优化结果报告为比已发表基线提升 40%。这些都是未公布方法论的内部结果。

有 Gemini 4 Argon 的模型卡或系统卡吗?

截至 2026 年 9 月 30 日还没有。DeepMind 模型卡索引中没有 Argon 条目,一手来源中也未找到针对 Argon 的能力或滥用评测。

现在应该把生产负载迁移到 Argon 吗?

不应该。目前没有可调用的公开模型 ID、没有已公布的速率限制、没有模型卡。生产环境应继续使用当前稳定的模型 ID,针对有文档记录的模型做原型,并在 API 文档列出 Argon 后再重新评估。

Argon 与 Gemini 3.8 是什么关系?

属于不同代际。Gemini 3.8 Flash 与 3.8 Live 是有稳定 ID 和已公布定价的文档化模型;Argon 是另行发布的前沿模型,其公开 API 接口面尚未公布。3.8 Flash Cyber 出现在 Google 的 Argon 安全图表中,作为对比基线。

来源

来源核对日期:2026 年 9 月 30 日。

延伸阅读:Gemini 3.8 Flash 完整指南、Gemini 3.8 Live 与 Extended Thinking 指南、Codex Security Cloud 与 Daybreak Blue 指南,以及GPT-6.1 Sol 基准与定价指南。