Google DeepMind 于 2026 年 9 月 30 日发布 Gemini 4 Argon — 定位为前沿模型,面向编码、企业知识工作与网络安全防御中的复杂工作流,并通过 Google 的 Fairwind Program 面向有限数量的可信测试者开放。 最受关注的技术指标是 100 万 token 的输出上限,Google 称其为业界领先,相比此前 Gemini 各版本的 64K 输出上限是一次大幅提升。Google 同时公布了引入期按 token 计费的价格,但截至发布当日,尚未把 Argon 加入公开的 Gemini API 模型列表与定价表。
本文只使用一手来源:Google 官方公告(作者为 Koray Kavukcuoglu)、DeepMind Fairwind Program 页面、2026 年 9 月 2 日的Fairwind 发布博文、Gemini API 现行的模型文档与定价页面、DeepMind 的模型卡索引与前沿安全框架页面,以及 Google 官方账号在 X 上的发布帖。以下所有数据均核对于 2026 年 9 月 30 日,即发布当天。
Google 发布了什么
首发公告来自 Google DeepMind 官方账号,将 Argon 定义为前沿模型,而不是既有档位的升级。公告列出的目标负载 — 编码、企业知识工作与网络安全防御中的复杂工作流 — 描述的是长时间运行的智能体任务,而非对话。与常规 Gemini 发布差异最大的是分发方式:首发当天面向一批可信测试者,入口是 Fairwind Program。
Introducing Gemini 4 Argon – our new frontier model. It’s built for complex workflows across coding, enterprise knowledge work, and cybersecurity defense – rolling out today to a set of trusted testers through our Fairwind Program.
— @GoogleDeepMind September 30, 2026
同一账号的后续帖直接回应了输出上限,而 Sundar Pichai 的长帖则给出了 Google 希望绑定在这款模型上的叙事:Google 内部已在大规模使用,反馈来自从编码到量子计算的各个团队。
With a 1M token output limit, Argon adds a deeper level of reasoning to tackle…
— @GoogleDeepMind September 30, 2026
Google 企业账号复述了同样的三个工作负载方向,并把输出上限列为差异点。把两段文案并列看,重点完全一致:同样的三个领域、同样的 1M 数字、同样的「前沿」定位。
Today we’re introducing Gemini 4 Argon. It delivers frontier performance in complex workflows across real-world software engineering, knowledge work, and cybersecurity defense with an industry-leading 1M token output limit.
— @Google September 30, 2026
Lots of discussion out there about our next model(!), so I wanted to give an early look as soon as possible. Introducing Gemini 4 Argon! It shows frontier performance in complex workflows, cyber defense and software engineering. Teams are using it extensively at Google, from coding to quantum computing, great feedback. Here’s a look at the benchmarks:
— @sundarpichai September 30, 2026
最后那条帖子值得仔细阅读,因为它为后文设定了证据标准。Google 描述的是自家内部使用情况与自家跑的基准。Pichai 说「这里是基准测试的结果」并附上图表,这使这些图表成为本文所引述结论的原始证据 — 但它们始终是厂商自测结果,而非独立评测。
1M token 输出上限
输出上限是悄悄塑造智能体架构的约束。当模型一次响应最多只能输出 64K token 时,长周期任务必须被切分为多步,状态要在多次调用之间传递,编排层承担把结果重新拼接起来的负担。把上限提高到 100 万 token 改变了这份负担的位置 — 原先需要循环完成的工作,现在可以由一次生成承载。
以下是 Google 官方渠道给出的对比数据:
| 规格 | Gemini 4 Argon | 上一代 Gemini |
|---|---|---|
| 输出 token 上限 | 1,000,000 token | 64K token(此前 Gemini 各版本) |
| Google 的表述 | 「业界领先的 1M token 输出上限」 | — |
| 宣称的推理效果 | 「加入更深层次的推理以应对」复杂任务 | — |
| 公开 API 模型 ID | 未出现在 Gemini API 模型列表中 | — |
| 独立验证 | 一手来源中未发现 | — |
这张表需要配三点限定。第一,本文核对的一手来源均未定义 1M 上限的确切语义 — 例如是否适用于流式输出、多轮续写,或按单次尝试计量。第二,Google 没有同时公布速率限制、延迟或首 token 时间。第三,由于截至 9 月 30 日 Argon 在公开 API 文档中没有模型 ID,外部开发者目前无法直接验证这一数字。
对于正在做容量规划的团队,务实的解读是:100 万输出 token 属于有限开放下宣布的能力,而不是可直接购买的档位。合理的做法是针对今天真正能调用的上限来设计,把更大的预算当作访问开放后的额外收益,而不是围绕一个尚无法测量的数字重构架构。
基准测试速览
Google 的公告在编码、通用智能体能力与长视频理解三个方面都给出了基准提升。本节所有数字都是厂商自测:对比模型由 Google 选定,评测由 Google 执行或委托执行,图表由 Google 发布。截至发布当日,在一手来源中未发现任何 Argon 数字的独立复现,这些数字也没有随附评测工具链配置或运行日志。
| 评测项 | Argon 结果 | Google 的表述 | 限定条件 |
|---|---|---|---|
| DeepSWE v1.1(软件工程) | 77.9% | 刷新最高水平 | 厂商自测;工具链与配置未完整公布 |
| Vals Index(经济影响力能力) | 表述为领先 | 该指数上的前沿位置 | 厂商自报;无独立复现的分数 |
| AutomationBench(Zapier) | 51.3% | 排名第一 | 厂商自测 |
| LVBench(长视频理解) | 91.7% | 最高水平 | 厂商自测 |
| CWE-bench v1(安全补丁) | 68% | 并列第一 | 三家 68% 并列;见下方图表 |
| Gray Swan 间接提示注入 | 鲁棒性曲线领先 | 对比集合中最稳健 | 攻击成功率越低越好;厂商自测 |
其中一行需要明确说明。CWE-bench v1 并不是干净的胜出:公开图表显示 Argon、Grok 4.7 与 GPT-6 Astra 在 68% 处三强并列。Google 标注 Argon 并列第一,这本身准确,同时也意味着该安全补丁结果并未把 Argon 与对手区分开。如果决策依赖这项基准,诚实的结论是平局,而不是领先。
同样的判断适用于整组基准。Google 选择的评测组合侧重软件工程、流程自动化、视频理解与安全,这确实是公告中三个工作负载方向的合理代理,但它不是通用能力指数;一个模型可能在这组特定评测上表现突出,同时在推理性或多语言任务上并不出众。
网络安全评测
网络安全结果是公告中图表篇幅最大的部分,这与首批开放对象是网络防御者相吻合。其中两张图表对应公开基准,另外两张对应 Google 内部或合作方执行的安全工作。
CWE-bench 衡量的是模型能否修补真实存在的漏洞类别。68% 在这样一项困难的基准上是实打实的进展,而图表把并列关系直接呈现出来,没有把它埋掉 — 对需要做判断的读者而言,这正是最有用的部分。
Gray Swan 图表的读数方向与其他几张相反:指标是攻击成功率,因此数值越低越好。Google 报告 Argon 在 k=15 次尝试下的攻击成功率为 0.7%,是对比集合中最稳健的表现。对于任何会读取不可信内容的智能体 — 网页、工单系统、邮件 — 间接提示注入鲁棒性是为数不多可以直接量化的安全属性,因此这张图比编码分数更具决策价值。
| 安全评测 | Gemini 4 Argon | Gemini 3.8 Flash Cyber | 状态 |
|---|---|---|---|
| 真实漏洞发现 | 85.8% | 71.0% | Google 内部基准 |
| Wiz 渗透测试基准 | 70.9% | 58.2% | 合作方执行,由 Google 报告 |
| CWE-bench v1 | 68%(并列第一) | 图表中列出 | 公开基准,厂商自测运行 |
| Gray Swan IPI 成功率 @ k=15 | 0.7%(最低) | 图表中列出 | 公开基准,厂商自测运行 |
这里的对比对象很能说明问题。Google 用自家面向网络安全调优的 3.8 Flash Cyber 作为 Argon 的对比基准,而不只是与竞品比较。在漏洞发现上比内部专用模型高出约 15 个百分点,是有意义的内部进步;但它同时是内部对比,在内部基础设施上评测,未公布测试集,读者应把绝对百分比视为方向性参考。Wiz 那一行性质不同:Wiz 是外部安全厂商,基准属于它,但结果仍由 Google 报告,且在一手来源中未找到 Wiz 对同一次运行的公开说明。
Google 内部实践
Google 给出了一组内部案例,这是公告中最具辨识度的部分,因为公司对具体工作描述得相当细,而不只是宣称效率提升。这些是内部结果,没有外部测试工具链,因此它们说明的是能力方向而非能力证明 — 但细节足够具体,可以据此推理。
| 内部工作 | 报告结果 | 说明了什么 |
|---|---|---|
| 语言迁移(C/C++ 转 Rust) | 替换 32K 行 SIMD 代码;结果报告为比此前的 Rust 移植快 2.7 倍,并更接近优化后的 C++ | 对性能关键代码的大规模机械式重构;「更接近」属定性表述 |
| Fuchsia Zircon 内核迁移 | 迁移 800K+ 行代码 | 1M 输出预算应用于单一超大代码库任务 |
| 内存效率优化 | 释放 300 TiB,估计可优化空间为 500 TiB 至 1 PiB | 基础设施规模的优化任务 |
| 量子优化 | 比已发表的基线提升 40% | 研究域工作;未公布方法论 |
| 广泛内部使用 | 据 Pichai 所述,团队「大量」使用 Argon,覆盖从编码到量子计算 | 对外开放前的长期内部试用 |
迁移类数字与输出上限的关联最直接。替换 32K 行 SIMD 代码,或迁移 800K+ 行内核代码,正是 64K 输出上限会让过程很别扭、而 1M 上限能让它用更少轮次完成的典型任务。这一关联是合理机制而非证明,因为 Google 未公布这两次迁移背后的提示结构、轮次数量或评审流程。
定性措辞需要谨慎对待。「比 Rust 移植快 2.7 倍」是两个内部产物之间的相对说法,「更接近优化后的 C++」是 Google 自己的描述,而非基准结果。量子优化数字没有公布基线引用或评测协议,因此最好把它理解为 Google 在这类问题上投入方向的信号,而不是可与任何外部结果对比的性能主张。
Fairwind Program 与开放节奏
访问权限是当前最关键的限制,而它通过 Fairwind Program 而非 Gemini API 实现。Fairwind 于 2026 年 9 月 2 日作为面向防御方的项目推出;DeepMind 项目页面称其与全球合作网络协作,并报告全球 650+ 家合作方。该数字覆盖整个项目,并非专指 Argon 的使用资格。
Fairwind 项目页面还把更早的 DeepMind 安全工作与此次发布连接起来,点名 Gemini 3.8 Flash Cyber 与 CodeMender — DeepMind 于 2025 年 10 月发布的代码安全智能体。Argon 是这条线的第三步:面向网络安全的调优模型、自动修补智能体,以及如今首批开放对象为防御方的前沿模型。
| 阶段 | 开放对象 | 渠道 | 已公布日期 |
|---|---|---|---|
| 一(已开始) | 可信测试者,Google 称其为首批网络防御者 | Fairwind Program | 2026 年 9 月 30 日 |
| 二(已宣布) | 付费 API 客户与 Google AI Ultra 订阅用户 | Gemini API、消费者订阅 | 未公布 |
| 三(已宣布) | 开发者、企业与普通消费者 | 完整接口面 | 未公布 |
第二、第三阶段都没有附加日期。这对规划影响很大:如果你在等待 Gemini API 上的 Argon,目前没有已公布的时间表可供参考。有近期需求的团队应确认 API 今天实际可用的模型,而不是围绕一个未公布的日期安排计划。
定价
Google 随公告公布了引入期定价。结构是促销价格在引入期后上调,同时对缓存输入提供大幅折扣,网络安全能力不单独溢价。
| 计费项 | 引入期单价 | 引入期后的标准单价 |
|---|---|---|
| 输入 | 每 100 万 token 2.00 美元 | 每 100 万 token 4.00 美元 |
| 输出 | 每 100 万 token 10.00 美元 | 每 100 万 token 20.00 美元 |
| 缓存输入 | 缓存部分享受 95% 折扣 | 标准期的折扣结构未公布 |
| 网络安全能力 | 无单独计费项 | 无单独计费项 |
| 公开发定价页条目 | 截至 2026 年 9 月 30 日不存在 | 截至 2026 年 9 月 30 日不存在 |
三点观察。引入期的输入与输出价格在促销结束后恰好翻倍,因此任何成本模型都应基于 4 / 20 美元构建,并把当前价格视为折扣而非定价。缓存输入折扣是可用杠杆中最大的一个:对于反复发送大段稳定前缀的智能体负载,缓存输入降低 95% 会压倒表中其他所有因素。此外,由于公开的 Gemini API 定价页(最后更新于 2026 年 9 月 8 日)没有对应条目,这些价格只存在于公告文本与发布图表中,尚未进入开发者会查阅的计费文档。
举个量级感受:在长时间生成类工作中输出 token 主导成本。按每百万输出 token 10 美元计算,一次 10 万 token 的生成产物在引入期约 1 美元,之后约 2 美元。这正是让 1M 输出预算既有趣又昂贵的那笔算术 — 一次完整的 100 万 token 生成在引入期约 10 美元,标准期约 20 美元,且还未计入输入成本。
当前 API 状态
这一节是公告与开发者文档不一致的地方,也是本次发布中最关键的实务缺口。
| 接口面 | 一手来源显示的内容 |
|---|---|
| Gemini API 模型列表 | 没有 Argon 模型 ID;该页最后更新于 2026 年 9 月 4 日,早于本次发布 |
| Gemini API 定价页 | 没有 Argon 定价条目;最后更新于 2026 年 9 月 8 日 |
| DeepMind 模型卡索引 | 未发布 Gemini 4 Argon 模型卡 |
| 安全文档 | 未找到针对 Argon 的评测报告 |
| 官方演示视频 | 在 Google 或 DeepMind 渠道上未找到 |
| 公告中的访问渠道 | Fairwind Program 可信测试者 |
这个模式是稳定的:面向市场的页面在发布当天同步更新,参考类页面尚未跟上。对有限开放的首发而言这属正常,但它有一个具体后果 — 没有公开模型 ID,外部开发者就没有可调用的对象,也没有已公布的速率限制、上下文窗口细节或区域可用性可供规划。
对封装模型调用的智能体与技能而言,这正是值得为之设计的现实情形:一款宣布了定价、但还无法寻址的新前沿模型。Gemini 3.8 Flash 指南与Gemini 3.8 Live 指南覆盖的都是已有稳定 ID 的模型,因此是本月内要上线的项目更稳妥的基础。
安全与保障
开放节奏的设定明显谨慎。访问从一小批防御者开始,这本身就是限制风险的决定:安全工作有清晰的正当用途、可衡量的结果,以及能够上报滥用的合作方。Google 的前沿安全框架页面描述了公司针对前沿模型的分阶段评估方式,公告也把该框架作为治理背景。
缺失的是针对 Argon 的具体证据。截至 2026 年 9 月 30 日,Google 尚未发布该模型的模型卡、能力阈值评估或滥用评测。读者目前无法把 Argon 与框架自身设定的阈值进行核对。诚实的总结是:Google 描述了一次负责任的渐进式开放,而让外部能够审计这一说法的那份文档尚未发布。
对智能体工作流的影响
先放下访问权限问题:Google 强调的能力指向四类如果说法成立就会变得更容易的工作流模式。
单次长生成。1M 的输出预算让「一次调用产出完整产物」变得合理 — 完整的迁移补丁集、跨文件的大型重构、生成的测试套件 — 而不必驱动由大量小改动组成的循环。代价是成本集中与评审难度:一个巨大的响应比十个小响应更难增量评审,因此工作流需要加一道验证步骤,而不是继续加提示。
具备可量化鲁棒性的安全审查。对智能体开发者而言,间接提示注入结果是本次发布中最可行动的数字。如果智能体会摄取网页、工单或邮件内容,注入鲁棒性就是活跃的威胁模型,0.7% 的攻击成功率是一个可以据以推理的数字 — 同时要记住它是在固定尝试次数下的厂商自测结果。
迁移与大型代码库工作。C/C++ 转 Rust 与 Fuchsia 的数字描述的是长周期代码变换,这正是输出上限历来迫使人们投入最多编排开销的工作负载类别。今天做这类工作的团队通常把它切分到多次调用;Argon 的定位则暗示可以合并轮次。
漏洞分类与修补。把更高的漏洞发现率与一项补丁类基准(CWE-bench)放在一起,描述的是从分类到修复的闭环。限定条件不变:两个数字都是厂商自测,且补丁结果是三强并列。
考虑到访问限制,一个务实的采纳顺序是:生产环境继续沿用当前模型 ID;今天就针对已有稳定公开 ID 的模型做原型;持续关注 Gemini API 的模型与定价页面是否出现 Argon 条目;如果你是防御方机构,把 Fairwind Program 当作入口来评估,而不是等待通用可用。如果你的工作依赖 1M 输出预算,在最终决定前先对长生成的成本做实测,因为这是定价表回报最少的一个维度。
注意事项
本文引用的所有测量结果均为厂商自报。基准由 Google 执行或委托执行,对比模型由 Google 选定,图表由 Google 发布。发布当日在一手来源中未发现任何 Argon 数字的独立复现;漏洞发现与量子优化等结果描述的是内部工作,未公布方法论。
安全基准的领先并不总是领先。CWE-bench v1 是三家在 68% 处并列。Google 使用「并列第一」的表述是准确的;把那一行当作胜出则不准确。
API 接口面尚未公布。没有模型 ID、没有定价条目、没有模型卡、没有速率限制、没有延迟数据、没有区域可用性。1M 输出上限尤其没有关于流式或多轮使用的语义说明。
上文嵌入的四条发布帖中有两条为节录。DeepMind 关于输出上限的帖子以及 Google 的衍生帖在所示开头分句之后仍有内容,完整文本可在链接的帖子中查看。本文没有对无法直接读取的文本做转述。
开放时间表未公布。从可信测试者到付费 API 客户再到通用可用的路径没有已公布的时间线,因此任何建立在 Argon 会按时进入公共 API 之上的计划都是假设。
内部结果属于例证。内存、迁移与量子相关数字说明 Google 在哪些地方使用该模型。它们无法与外部基准直接比较,而在「比 Rust 移植快 2.7 倍」这一例中,基线本身也是内部产物。
选型建议
可以使用 Argon,如果你是防御方机构或拥有 Fairwind 访问权限的合作方,且工作涉及漏洞发现、大规模安全修补或长周期代码迁移。1M 输出预算与网络安全评测表现的组合正对准这类工作,而在引入期价格下,它的定价相对其他前沿方案具有竞争力。
建议等待,如果你需要稳定的公开模型 ID、已公布的速率限制、模型卡或已记录的安全评测。Argon 目前都不具备。对于本月要上线的生产代码,有稳定 ID 的模型是更稳妥的选择,而 3.8 Flash 档位以更低的成本覆盖了大多数高并发负载。
值得持续关注,如果你的架构受输出上限影响。1M 预算是最有可能改变长周期智能体结构方式的规格,值得在 API 文档补齐时跟进 — 届时的实务问题会变成速率限制、延迟,以及缓存输入定价在标准档位是否延续。
常见问题
Gemini 4 Argon 是什么?
Google DeepMind 于 2026 年 9 月 30 日发布的前沿模型,面向编码、企业知识工作与网络安全防御中的复杂工作流。Google 称其提供前沿性能,并具备业界领先的 1M token 输出上限。
我现在可以通过 Gemini API 使用 Gemini 4 Argon 吗?
作为有文档记录的公开模型还不行。Gemini API 模型页(最后更新于 2026 年 9 月 4 日)没有 Argon 条目,定价页(最后更新于 2026 年 9 月 8 日)没有 Argon 价格行。目前的访问通过面向可信测试者的 Fairwind Program 进行。
1M token 输出上限是什么,为什么重要?
它是 Argon 单次响应可生成的最大 token 数,相比此前 Gemini 版本的 64K 上限大幅提高。更大的输出预算意味着长周期工作可以用更少的轮次完成,而不必拆分到大量调用中。Google 尚未公布该上限在流式输出或多轮续写下的确切语义,也没有公布速率限制或延迟数据。
Gemini 4 Argon 的价格是多少?
引入期价格为每 100 万输入 token 2.00 美元、每 100 万输出 token 10.00 美元,缓存输入享受 95% 折扣。引入期结束后,这两个价格翻倍至 4.00 美元与 20.00 美元。这些价格目前都未出现在公开发定价页上。
Google 公布了哪些基准结果?
DeepSWE v1.1 为 77.9%(称刷新最高水平)、AutomationBench 为 51.3%(称排名第一)、LVBench 为 91.7%、Vals Index 上处于领先位置、CWE-bench v1 为 68% 并列第一,以及 Gray Swan 间接提示注入上领先的鲁棒性表现。全部为厂商自报,无独立复现。
CWE-bench 的结果算是胜出吗?
不算 — 是 Argon、Grok 4.7 与 GPT-6 Astra 在 68% 处的三强并列。Google 标注 Argon 并列第一,这准确,但这项基准并未把 Argon 与对手区分开。
Fairwind Program 是什么?
Google 于 2026 年 9 月 2 日推出的面向防御方的项目,也是 Argon 首批开放对象的访问路径。DeepMind 项目页面报告全球 650+ 家合作方,并点名了更早的 DeepMind 安全工作,包括 Gemini 3.8 Flash Cyber 与 CodeMender 修补智能体。
Argon 什么时候通用可用?
Google 公布了开放顺序 — 可信测试者,然后是付费 API 客户与 Google AI Ultra 订阅用户,再到开发者、企业与消费者 — 但没有公布后续阶段的任何日期。
Google 内部用 Argon 做了什么?
报告的内部工作包括:C/C++ 转 Rust 的迁移替换了 32K 行 SIMD 代码;Fuchsia Zircon 内核迁移超过 800K 行;内存优化释放 300 TiB,估计可优化空间为 500 TiB 至 1 PiB;量子优化结果报告为比已发表基线提升 40%。这些都是未公布方法论的内部结果。
有 Gemini 4 Argon 的模型卡或系统卡吗?
截至 2026 年 9 月 30 日还没有。DeepMind 模型卡索引中没有 Argon 条目,一手来源中也未找到针对 Argon 的能力或滥用评测。
现在应该把生产负载迁移到 Argon 吗?
不应该。目前没有可调用的公开模型 ID、没有已公布的速率限制、没有模型卡。生产环境应继续使用当前稳定的模型 ID,针对有文档记录的模型做原型,并在 API 文档列出 Argon 后再重新评估。
Argon 与 Gemini 3.8 是什么关系?
属于不同代际。Gemini 3.8 Flash 与 3.8 Live 是有稳定 ID 和已公布定价的文档化模型;Argon 是另行发布的前沿模型,其公开 API 接口面尚未公布。3.8 Flash Cyber 出现在 Google 的 Argon 安全图表中,作为对比基线。
来源
来源核对日期:2026 年 9 月 30 日。
- Gemini 4 Argon 公告 — Google 官方博客
- Fairwind Program — Google DeepMind
- Google 的 Fairwind Program — Google 官方博客,2026 年 9 月 2 日
- Gemini API 模型文档
- Gemini API 定价
- 模型卡索引 — Google DeepMind
- 前沿安全框架 — Google DeepMind
- CodeMender 发布 — Google DeepMind
- @GoogleDeepMind 发布帖、输出上限后续帖、@Google 发布帖,以及 @sundarpichai 说明帖
延伸阅读:Gemini 3.8 Flash 完整指南、Gemini 3.8 Live 与 Extended Thinking 指南、Codex Security Cloud 与 Daybreak Blue 指南,以及GPT-6.1 Sol 基准与定价指南。




