title: "介绍基于 Gemini 的智能体视频理解"
source_url: "https://deepmind.google/blog/introducing-agentic-video-in-gemini/"
author: "Google DeepMind News"
excerpt: "公共早报 Google DeepMind 让 Gemini 按任务选择视频片段、播放速度和视觉、音频或转录模态,只抓取所需信号。其基准结果称分析成本最高降低 66%、Token 消耗最高降低 88%,准确率最高提升 7%。读者能看清这项能力为何更适合长视频检索、异常检测和精确计数,也能判断接入成本。"
今天,我们面向最新的 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型推出智能体视频理解。这一新功能在大幅降低视频分析的 Token 使用量和成本的同时提升了准确率。与结合了代码执行与 Gemini 模型原生图像理解的智能体视觉类似,智能体视频理解利用 Gemini 的原生视频工具来提升性能,并为视频处理解锁更多新能力,例如亚秒级时刻检索、更精确的异常检测、精确计数等。
该功能现已在 Google AI Studio 的 Gemini API 和 Gemini Enterprise Agent 平台上线,支持视频上传和 YouTube 视频。
基准测试
与当前的"静态"处理(模型以固定帧率摄取视频,默认 1 FPS,可通过 API 调整)不同,智能体视频理解将模型的核心推理能力与原生视频工具相结合,能够跨视觉帧、音频和转录文本动态搜索、扫描和检查目标视频片段。在标准视频分析基准测试中,具备智能体视频理解的 Gemini 模型分析成本最高降低 66%,Token 消耗最高降低 88%,同时准确率最高提升 7%。
这些效率提升在长视频(从 10 分钟的教程到 90 分钟的讲座乃至数小时录制)中尤为显著,因为静态处理迫使开发者不得不在高昂的 Token 成本与可能遗漏关键细节的技术之间做出权衡。
启用智能体视频理解后,Token 消耗最高降低 88%,Gemini 3.7 Flash 的准确率最高提升 7%。
虽然这三个支持的模型均有上述提升,但具备智能体理解的 Gemini 3.7 Flash 整体质量最优,且质量和成本效益的组合最佳,使其处于视频理解测试模型中准确率与成本的帕累托前沿。
使用智能体视频理解使 Gemini 3.7 Flash 处于视频分析准确率与成本的帕累托前沿。
工作原理
智能体视频理解并非以固定帧率摄取媒体流的静态处理,而是让 Gemini 扮演主动的、目标导向的角色,决定观看什么、以什么速度以及通过哪种模态(帧、音频或转录文本),仅获取所需的时刻和信号。虽然开发者之前可以手动完成这些操作,但有了智能体视频理解,Gemini 可以通过一个智能体循环来完成它,调用内部工具加载视频文件的相应部分,从而显著减少开发开销。
能力与用例
智能体视频理解改变了开发者处理各种高需求应用中长视频内容的方式。
亚秒级时刻检索:精确定位在 1 FPS 下容易遗漏的瞬时状态变化和紧凑的切镜边界,使精确的自动化视频编辑成为可能。
长视频大海捞针式搜索:无需消耗数百万 Token 即可回答跨数小时视频的复杂查询。
异常检测:以更高的 FPS 对感兴趣的时间窗口进行重采样,以检查快速运动和细微的视觉伪影。
动作与物体计数:随着时间精确跟踪重复的身体动作和不同物体。
实际效果
我们的许多早期访问合作伙伴在测试智能体视频理解时看到了强劲的性能表现。以下是他们给出的评价:
开始使用
智能体视频理解可通过 Google AI Studio 的 Gemini API 和 Gemini Enterprise Agent 平台使用,面向 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出。它使用标准 Gemini API Token 定价,不收取额外功能费用。
要启用它,只需在 API 配置中将处理模式设置为"agentic"(智能体)。阅读我们的开发者指南以获取更多关于该功能及如何入门的见解。
我们还将把智能体视频理解的效率和和质量改进带给 Google 产品中数十亿用户。该功能将很快向 Gemini 应用中所有 Flash 和 Flash-Lite 模型的用户推出。在未来几个月内,智能体视频理解还将为 YouTube 视频观看页面上的"询问 YouTube"功能提供支持,利用 Gemini 在视觉内容基础上提供更高质量的答案。
感谢以下人员对本工作的贡献: Sergi Caelles、Filip Pavetić、Ahmet Iscen、Suhas Yogin 以及智能体视觉团队。