返回知识库
0

title: "GPT-6 Astra 安全概览:能力、对齐与部署监控"
source_url: "https://openai.com/index/safety-overview-gpt-6-astra"
author: "OpenAI News"
excerpt: "公共早报 GPT-6 Astra 达到 OpenAI 准备度框架的关键级网络安全门槛,正式部署同时引入覆盖工具调用的失配监控。安全概览披露,对齐与抗注入能力改善,思维链可监控性却有所下降。把这些结果放在一起,能更准确地判断高能力智能体需要怎样的授权、监控与审计设计。"


今天,我们正式发布 GPT‑6 Astra,这是我们迄今为最广泛部署的能力最强的模型。Astra 是我们的 Preparedness Framework 下首个达到关键级(Critical)网络安全能力的模型。

关于此次发布的安全要点,最重要的是以下几点:

  1. GPT‑6 Astra 在网络能力上实现了重大飞跃,并达到了我们的关键级阈值。 这意味着,凭借适当的工具和访问权限,GPT‑6 Astra 能够在无需人工引导每一步的情况下,发现众多受保护系统中的未知安全漏洞并开发新的利用方法。因此,我们显著加强了针对模型采取有害网络行为的防护措施,无论这些行为是源于滥用还是失配。我们还采取措施保护 Astra 及类似模型的内部开发和部署,包括更严格的隔离、检查点加密、对包括思维链(CoT)在内的完整轨迹的全面监控,以及在使用前进行阻止式对齐评估流程。

  2. GPT‑6 Astra 比其前身显著更加鲁棒。 通过融入新的鲁棒性安全训练技术,GPT‑6 Astra 在越狱攻击方面比 GPT‑5.6 Sol 显著更加鲁棒,包括在更长轨迹上。我们通过离线测试以及严格的内部和外部越狱测试与修复计划确认了这一点。对于被标记为潜在高风险的用户,我们还额外训练了调整模型拒绝边界的能力,使其更加保守并覆盖更广泛的 dual-use 风险。我们使用回归测试确保 Astra 能够抵御先前测试期间发现的越狱攻击,并进行了多轮使用最新内部红队攻击者的自动化红队测试,以验证我们的改进。

  3. GPT‑6 Astra 比 GPT‑5.6 Sol 对齐更好。 Astra 在模型对齐方面实现了重大进步,其对齐改进涵盖从预训练数据组成到强化学习评分的各个环节。我们发布了一套新的对齐评估⁠(在新窗口中打开),发现 GPT‑6 Astra 在尊重安全和安保边界以及保持在授权范围内方面表现更强。在使用超过 54,000 个内部 Codex 任务⁠(在新窗口中打开) 进行的模拟中,Astra 收到的高严重性失配行为标记数量约为 Sol 的一半。

  4. 我们正在广泛部署失配监控。 我们将模型对齐视为防止模型潜在失配行为的主要杠杆。然而,监控为前沿模型行为提供了广泛的可见性,揭示了进一步改进对齐和安全的机会。此外,监控作为检测到的失配行为的额外保护层。出于这些原因,我们已额外在 Astra 外部部署中涉及的所有工具调用推理中添加了失配监控,代价显著。该系统与我们的内部设置类似。

  5. GPT‑6 Astra 的可监控性相对于 GPT‑5.6 Sol 有所下降。 我们对 GPT‑6 Astra 的可监控性⁠(在新窗口中打开)和可控性⁠(在新窗口中打开)进行了深入调查。我们发现 GPT‑6 Astra 比 GPT‑5.6 Sol 更能控制自己的 CoT,且不太可能在 CoT 中包含定罪信息。在对抗性设置中(我们推动模型规避监控),我们发现模型能够在战略性表现不佳(作弊)时保持不被检测,并且在被要求执行某些破坏任务⁠(在新窗口中打开)时有时能够规避我们的内部监控。我们尚未看到思维链推理隐写术的证据(例如,在普通且看似无关的文本中隐藏推理),这表明规避风险可能主要局限于较低推理任务。

    • 这些发现表明,Astra 类模型在对抗条件下可能规避我们的 CoT 监控。目前,这些发现主要基于对抗性评估(即当我们指示模型规避监控时),总体而言我们的对齐评估显示,在整体上 Astra 违反安全和安保限制的可能性低于 GPT‑5.6 Sol。

    • 然而,我们认真对待这一趋势,随着模型变得越来越有能力,我们继续调查这些发现及其对可监控性的影响。OpenAI 已努力保留并利用思维链监控,保留 CoT 可监控性是研究项目的核心目标。然而,这些结果也强调了开发超越检查模型思维链的对齐审计技术的重要性。

  6. GPT‑6 Astra 在浏览和工作环境中的导航更加负责任: GPT‑6 Astra 在提示注入方面比 GPT‑5.6 Sol 显著更加鲁棒。我们还测试了模型在真实浏览和专业计算环境中的行为,发现与 GPT‑5.6 Sol 相比,模型执行失配和潜在破坏性行为(例如未经授权的交易、数据丢失、过度访问或规避控制)的可能性显著降低。在代理设置中处理有害请求时,它也表现得更安全,例如协助暴力攻击规划或实施欺诈的请求。

  7. GPT‑6 Astra 在高风险场景中显著更安全。 GPT‑6 Astra 对来自生产环境和对抗性人工红队测试的挑战性请求的响应比 GPT‑5.6 Sol 更加安全。Astra 在安全完成不安全请求和避免对无害请求的不必要拒绝之间实现了帕累托改进。这些改进延伸到高严重性场景,即伤害风险来自更广泛的上下文而非明确请求。Astra 还更一致地为 18 岁以下用户应用适合年龄的安全边界。

更多信息,请参阅完整的系统卡⁠(在新窗口中打开)。

AI知识库 / GPT-6 Astra 安全概览:能力、对齐与部署监控 0 字 0 行 iliuqi
2026-09-04T08:59:38.242942Z 2026-09-04T09:42:49.758306013Z