功能解读官方来源

Gemini 智能体视频理解完整指南

Google DeepMind 让 Gemini 学会“决定看哪里”:agentic 视频理解在提升准确率的同时,把长视频分析的 token 最多削减 88%、成本最多降低 66%。本文基于官方博客、开发者指南与发布推文,讲清工作原理、API 用法与选型边界。

Gemini agentic 视频理解概念封面:AI 智能体通过时间轴、帧切片与音轨波形检查视频内容
本文配图:Google 官方博客 发布的图表与演示,封面为示意插画。

Gemini 的 agentic 视频理解让模型不再以固定帧率通读整个视频,而是像一个智能体一样决定看哪一段、看多快、看哪种信号。Google DeepMind 于 2026 年 9 月 1 日发布该功能:在官方基准上,token 最多减少 88%、分析成本最多降低 66%、准确率最高提升 7%,现已通过 Gemini API 在 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 上可用。

本文基于 Google 官方发布博客AI Studio 开发者指南,以及 Google DeepMind、Google、Google AI Studio 和 Gemini API 负责人 Logan Kilpatrick 的官方推文整理,检查于 2026 年 9 月 1 日。所有基准数字来自官方图表,并配有原始图片。

Google 发布了什么

官方博客由 DeepMind 高级产品经理 Rohan Doshi 与研究总监 Mario Lučić 署名。要点如下:agentic 视频理解当日起通过 Gemini API 在 Google AI Studio 与 Gemini Enterprise Agent Platform 上线,覆盖视频上传与 YouTube 链接,支持 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 三款模型,采用标准 token 定价,没有额外功能费。

与 Google 之前把代码执行和原生图像理解结合的 agentic vision 类似,这次的 agentic video 把同样的思路搬到了视频上:让模型用原生视频工具在时间轴上主动检索,而不是被动接收一整条均匀采样的帧流。官方特别点名了几类由此解锁的任务:亚秒级时刻检索、多小时视频的“大海捞针”式搜索、异常检测,以及对重复动作和不同物体的精确计数。

核心数据与基准测试

官方图表给出了三组关键数字,先看整体结论,再看逐基准分解。

指标提升幅度说明
Token 消耗最多 -88%长视频基准(1H-VideoQA、LVBench)达到 88.0%;MinerVa 为 58.4%
分析成本最多 -66%长视频任务上随 token 减少同步下降
准确率最高 +7%官方口径为“最高提升 7%”;图表标注为 7.2% 相对提升(MinerVa)
官方信息图:对比 3.7 Flash 与 3.7 Flash with agentic 在 MinerVa、1H-VideoQA、LVBench 上的每查询 token 数与准确率
官方基准信息图(高分辨率原图见 Google 官方推文):蓝色为开启 agentic 后的结果。下表为图中数据的手打转录。
基准Token 变化节省准确率变化相对提升
MinerVa(复杂推理)80.9K → 33.6K58.4%73.7% → 79.0%7.2% 相对提升
1H-VideoQA(长视频理解)397.6K → 47.7K88.0%87.5% → 88.5%1.1% 相对提升
LVBench(长视频理解)300.3K → 36.0K88.0%85.1% → 88.6%4.1% 相对提升

注意官方脚注的口径:对比条件为“high thinking level, low media res, 1 FPS for static processing”,即 static 侧使用高思考档位、低媒体分辨率与默认 1 FPS。你的真实收益取决于自己的采样配置。

工作原理:观察-思考-行动循环

开发者指南把机制描述为一个服务端工具循环,取代“先解码全部时间轴再填满上下文”的旧模式。流程分四步:

第一步是按引用传递:API 只传一个轻量指针,初始上下文仅含视频元数据(时长、容器格式、文件 ID)。第二步规划:模型根据提示词判断需要什么信息、去哪种模态找。第三步执行定向工具调用:优先读带时间戳的语音转写来定位相关片段;需要看画面时只加载相关时间窗(例如第 14 到 16 秒),并自行调整帧率——快速运动用 5–10 FPS,粗扫全片可低到 0.1 FPS;当声学线索、音乐或语气重要时直接抽取音频流。第四步观察与综合:检索到的片段作为观察结果返回,模型可以继续下一轮循环,或给出最终的有据回答。

官方架构图:Query 进入 Gemini,模型在 Observation(帧、音频或转写)与 Think 之间循环,调用 get_transcript、get_frames(start, end, fps)、get_audio(start, end) 三个工具后输出文本
官方架构图(经 Philipp Schmid 推文流传):模型的工具面包括转写、定帧率取帧和取音频三类。

这个设计解释了 token 节省从何而来:token 只为实际进入上下文的媒体付费,而 agentic 模式下进入上下文的只有元数据加被点名检索的片段。它也解释了准确率提升——1 FPS 均匀采样天然会错过亚秒级事件,而定向重采样不会。

API 快速上手

开启方式是在视频输入项上加一个字段:processing: "agentic"。下面是官方博客给出的最小示例:

深色代码编辑器截图:Google I/O Video test 示例,gemini-3.7-flash 处理 YouTube 视频并将 processing 设为 agentic
官方演示代码(Logan Kilpatrick 推文):一段 YouTube 视频、一条指令,唯一的新参数是 processing: "agentic"。
from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[
        {
            "type": "video",
            "uri": "https://youtu.be/7Z5Vy9JBANs",
            "processing": "agentic",
        },
        {
            "type": "text",
            "text": "这场主题演讲最重要的三个发布是什么?",
        },
    ],
)

print(interaction.output_text)

上传本地文件时先走 Files API,等 video_file.state.name 不再是 PROCESSING 再发起请求;YouTube 公开链接可以直接作为 uri 传入。官方 guide 还演示了在同一请求里打印 interaction.usage.total_tokens 来核对实际消耗。

混合模式与多视频请求

processing 按 media item 独立设置。官方指南给的场景很典型:一段 45 分钟的完整比赛录像用 agentic 处理,一段 10 秒的集锦片段保持 static,让模型在长录像中精确定位集锦出现的时刻。一个请求里也可以混合不同处理策略的多路视频。

agentic 与 static 模式选型

官方指南的默认建议是“从 agentic 开始”,尤其当你优化的是回答质量或 token 效率。两个模式各有适用区:

维度processing="agentic"processing="static"
适用长度约 5 分钟以上:讲座、 webinar、财报电话会、体育转播、媒资档案约 5 分钟以内:产品 GIF、UI 动画、社交短视频
任务类型精确定位时间戳、快动作分析、转写优先加视觉验证的查询延迟敏感、需要全片帧级精度的查询
工作方式服务端工具循环,按需检索转写/帧/音频固定帧率(默认 1 FPS,API 可调)整体采样

两位发布者对边界的口径略有差异:官方指南写“约 5 分钟”,DeepMind 的推文称收益在“10 分钟指南到数小时录制”上最显著,Philipp Schmid 则建议 2 分钟以内保持 static。保守做法是:短视频沿用 static,长视频切 agentic,再用 usage.total_tokens 实测自己的分界点。

定价与计费方式

agentic 模式没有功能附加费,按所用模型的标准 token 定价计费。计费规则有三点值得注意:视频输入 token 只按执行中实际物化的部分计费(初始轻量引用,加上模型点名检索的帧切片与音频段);思考与输出 token 按标准输出与思考费率计费;多轮会话中重复加载的视频会触发标准隐式缓存,也支持显式缓存实例。Batch API 同样支持 agentic 视频处理,价格为标准的 50%。

Gemini 应用与 YouTube 后续计划

官方博客明确了两个后续落点:该能力“即将”以 Flash 与 Flash-Lite 模型的形式推向 Gemini 应用的全部用户;未来几个月内,agentic 视频理解还将为 YouTube 观看页的 Ask YouTube 功能提供支持,用 Gemini 生成基于画面证据的更高质量回答。

开发者反响与限制

发布数小时内,官方推文获得可观互动:Google 主账号发布视频 156K 次观看,DeepMind 发布推文串 47K 次观看,Logan Kilpatrick 的 API 公告 41K 次观看、945 个赞。社区讨论集中在一点:这到底是不是“真 agentic”。有用户质疑“这不是 agentic 视频,只是帧率上限,88% 的 token 是你根本没发的帧”,Kilpatrick 回应称关键在于“模型自己决定看哪些帧”。

从官方文档看,事实介于两者之间:模型确实在循环中自主决定检索哪些片段、用什么帧率、走哪种模态,这是行为上的 agentic;但被跳过的部分确实不会进入上下文。对“大海捞针”式任务这是特性,对“通读全片”式任务(例如要求穷举所有画面事件)则是边界——官方博客的用例清单也全部是检索与定位型任务,没有全片穷举类任务。

实用建议

把官方信息折算成动作清单:

适合切换的:播客与讲座归档检索、会议录像问答、体育与监控片段的事件定位、媒资库的“找到某个时刻”类搜索。这些任务的查询有明确目标,转写往往能先定位、再用视觉验证。保持 static 的:短视频、延迟敏感的交互、需要全片逐帧精度的任务。先试再切的:实时或近实时场景——工具循环会引入额外往返,官方文档没有给出延迟数字,用 usage.total_tokens 和端到端延迟各自实测。迁移检查:在请求里保留原 static 配置作为对照,用同一组问题跑两种模式,比较输出质量、token 与延迟后再全量切换。

常见问题

什么是 Gemini agentic 视频理解?

这是 Google DeepMind 于 2026 年 9 月 1 日推出的 Gemini API 视频处理模式。与以固定帧率(默认 1 FPS)加载整个视频的 static 处理不同,模型会主动循环调用内部工具,按需检索部分转写文本、帧序列或音轨,再综合得出回答。

如何在 API 中开启?

在视频输入项中设置 processing: "agentic"。该功能通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 上线,适用于 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。

真的能节省 88% 吗?

88% 是官方基准测试的上限:1H-VideoQA 和 LVBench 的长视频任务 token 从约 400K/300K 降至约 48K/36K(88.0%),MinerVa 的节省为 58.4%。实际节省取决于视频长度和查询类型。

短视频也应该用 agentic 吗?

官方指南建议短视频(约 5 分钟以内、延迟敏感或需要全片帧级精度的查询)继续使用 static。Philipp Schmid 的总结更为保守:2 分钟以内的视频保持 static。

需要额外付费吗?

无需功能附加费。按标准 token 定价,只为实际加载的媒体 token(初始引用加检索到的帧切片与音频段)以及推理和输出 token 付费。Batch API 支持该模式,费用为标准的 50%。

它和 Gemini 应用里的视频分析有什么区别?

agentic 视频理解目前面向开发者(Gemini API 与 AI Studio)。官方表示该能力将很快以 Flash 与 Flash-Lite 模型形式面向 Gemini 应用用户推出,未来还将为 YouTube 的 Ask YouTube 提供支持。

官方来源

本文所有关键陈述均可追溯到以下第一方来源(2026 年 9 月 1 日访问):

相关阅读:Gemini Omni 完全指南Gemini 3.5 Flash 开发者指南开发者正在用 Gemini Omni Flash 构建什么