title: "Google 发布 Gemini 3.8 Flash 系列:升级编码与漏洞修复"
source_url: "https://deepmind.google/blog/introducing-gemini-3-8-flash-and-38-flash-cyber/"
author: "Google DeepMind News"
excerpt: "公共早报 Google 发布 Gemini 3.8 Flash 与 Cyber,面向长周期编程和自主任务提升推理能力,Cyber 侧重漏洞发现与补丁生成。Flash 沿用上一代单价,但更多推理可能增加 token 消耗,Cyber 限受信防御者使用。企业可结合披露的基准和使用案例,按任务效果、实际成本和接入条件判断是否试用。"
三周前发布的 3.7 Flash 势头正劲,距今仅六周内我们已推出第三个 Flash 系列——今天正式发布 Gemini 3.8,这是我们迄今为止最强的推理与编程模型,保持与 3.7 相同的速度与低成本。Gemini 3.8 包含两个版本:
Gemini 3.8 Flash: 最智能的主力模型,在软件工程、Agent 任务和专业领域的多步关键推理方面相比 3.7 Flash 有显著提升。定价与 3.7 Flash 相同,每百万输入 tokens 0.75 美元,每百万输出 tokens 3.75 美元1{#footnote-source-1}。
Gemini 3.8 Flash Cyber: 最强大的网络安全模型,在漏洞发现和自动修复方面具备前沿级性能,通过我们的全新 Fairwind 计划 向受信防御者开放。
尽管面向不同的部署环境,但今天发布的两个版本都基于相同的基础智能,并进一步由长周期 Agent 循环加速驱动,旨在递归评估和优化底层模型。这一共同核心在编程和推理方面取得的显著提升,得益于多项创新,包括在要求极为苛刻的网络安全领域的严格训练。
Gemini 3.8 Flash:面向长周期编程和自主 Agent
Gemini 3.8 Flash 相比 3.7 Flash 有实质性提升,往往接近更高成本的前沿模型水平。
在 DeepSWE v1.1(长周期软件工程) 上,3.8 Flash 以极低的成本超越了大多数更大的前沿模型,能够自主端到端解决复杂工程问题。
此外,3.8 Flash 还具备关键企业自主任务所需的可靠性,覆盖专业知识领域。在需要高级分析和报告的量化及专业领域,3.8 Flash 在 Vals Finance Agent V2 和 Harvey's Legal Agent Benchmark 等基准测试中超越了 3.7 Flash 和其他前沿模型。3.8 Flash 在 HLE-Verified 上达到 54.9%,展示了其在 STEM、人文和专业领域处理多步推理的能力。
这些性能提升源于一个核心设计选择:3.8 Flash 更加勤奋。在复杂任务上,它表现出更高的严谨性——执行额外的推理步骤,迭代调用工具。有时模型可能会使用更多 tokens 来最大化性能,尤其是在较高努力级别下。
对于计算效率是主要约束的应用场景,开发者可以利用较低的努力级别来最小化 token 开销,或者继续使用 Gemini 3.7 Flash(仍完全支持效率优先的工作负载)。
Gemini 3.8 Flash Cyber:专业的网络安全性能
Gemini 3.8 Flash Cyber 通过 Fairwind 计划 向部分受信防御者开放,在当今复杂的网络安全环境中提供决定性优势,具备 Flash 的速度和成本,可实现快速迭代。
自主漏洞发现
在业界标准的漏洞发现基准 CyberGym 上,Gemini 3.8 Flash Cyber 展示了前沿级的自主漏洞发现性能。它超越了 3.5 Flash Cyber 以及明显更大的前沿模型。
为了更好地捕捉现实世界的防御需求(不仅限于 CyberGym 中的 C/C++ 代码库),我们还在一个综合内部基准上评估了 Gemini 3.8 Flash Cyber:模型需要在横跨 20 种编程语言的复杂代码库中发现各种漏洞。在这项评估中,模型展示了相比之前模型的惊人飞跃,成功率超过 70%。
自动修复
借助 Gemini 3.8 Flash Cyber,我们专注于为防御者提供超越攻击者的专业能力。这就是为什么我们从一开始就投资于漏洞修复,并将其优先于利用等攻击能力。
由 Collinear 运营的 CWE-Bench 是修复能力的挑战性外部基准。在这个基准上,Gemini 3.8 Flash Cyber 处于帕累托前沿:pass@1 为 47.2%,而领先的前沿模型为 47.8%,但成本显著更低。
真实影响:保护 Google 的代码
我们已经使用 Gemini 3.8 Flash Cyber 来保护 Google 各处的代码。例如:
Chrome 安全团队发现,3.8 Flash Cyber 产生的正确补丁数量是更大商业模型中最佳模型的 2.6 倍,针对 Chrome 中的漏洞修复。
Wiz 发现,Gemini 3.8 Flash Cyber 在其内部渗透测试基准上以 2.3-5.2 倍 更低的成本实现了比其他领先前沿模型高 +7.5-9.7% 的召回率。
Google Cloud 漏洞研究团队利用 3.8 Flash Cyber 模型在不到 2 小时内发现了一个关键的基础设施漏洞,而这类研究和发现通常需要数月时间。
Fairwind 计划合作伙伴评价
抱歉,您的浏览器不支持嵌入式视频,但不用担心,您可以下载并用您喜欢的视频播放器观看!
内置安全设计
3.8 Flash 在化学、生物、辐射和核(CBRN)以及网络攻击领域配备了防止滥用的保障措施,同时按照我们的前沿安全框架支持有益用例。3.8 Flash Cyber 配备了更为宽松的网络安全缓解措施,因此仅对需要更全面网络能力的受信防御者开放。
Gemini 3.8 模型在 Gray Swan 测量的提示注入鲁棒性方面也取得了显著飞跃,保护 Gemini 模型用户免受与提示注入相关的恶意攻击。
Gemini 3.8 Flash 和 Cyber:立即开始
开发者:在 Google Antigravity 中使用 3.8 Flash 构建并探索 Agent 优先工作流,或通过 Google AI Studio 和 Android Studio 在 Gemini API 中开始构建,或在 Stitch 中生成 UI。请参阅我们的开发者文档开始使用。
企业:在 Gemini Enterprise 中访问 3.8 Flash。
消费者:3.8 Flash 已面向 Google AI Pro 和 Ultra 订阅者在 Gemini 应用、Google 搜索的 AI Mode 以及 Google Sheets 中的 Gemini 上可用。
网络安全的合作伙伴:通过我们的全新 Fairwind 计划,我们为受信的政府机构、关键基础设施运营商和软件维护者提供 Gemini 3.8 Flash Cyber 的优先访问权限。申请访问。