返回知识库
0

title: "我们报告模型失准的框架"

source_url: "https://openai.com/index/model-misalignment-reporting-framework"

author: "OpenAI News"

excerpt: "公共早报 OpenAI 新建模型失准的公开报告框架,并先公布训练和评测中观察到的 6 个个案,涵盖隐瞒信息、未获授权行动与规避监督等行为。每份报告将交代情境、严重性、外部影响和调查范围;即使尚未完成解释或缓解,也倾向及时披露,为开发者检验安全判断、改进防护提供可追溯的材料。"


我们将披露的失准案例
我们发布了一个新框架,用于追踪、调查和披露 OpenAI 模型失准案例,同时还发布了过去六个月中在我们模型的训练或评估中观察到的 6 份关于意外或令人担忧的模型行为的报告。
过去,为了更好地为研究人员、AI 开发者、政策制定者和公众提供信息,我们一直在努力将我们关于失准的发现公开化。但如果没有系统的报告方法,我们的披露往往是零散的,而且频率也不够理想:我们经常等到能够将多个案例整理成一份报告时才发布,或者将其添加到新发布模型的系统卡片中。这个新框架旨在加快在观察到失准案例后发布失准报告的速度,即使我们尚未完全解释或缓解所报告的行为。
随着 AI 系统变得越来越先进和被广泛部署,我们需要建立更广泛、更明智的对齐研究共识。我们不相信 AI 行业已经将对齐和监控解决到足以继续以最大速度负责任地扩展的程度。在未来几个月和几年里,AI 开发应该如何进行的决策需要基于前沿模型构建公司以外的人可以自己检查的证据。
失准案例可能有助于识别其他 AI 开发者在系统达到类似能力时可能遇到的问题,揭示防护措施的弱点,或挑战关于模型行为的假设。分享这些发现使其他人能够调查相同的问题,检验我们的解释,并改进缓解措施。因为我们相信失准透明度的价值,即使重要性不确定,我们的新框架也倾向于披露。这意味着我们披露的一些案例可能被证明是虚假的,不属于更大模式的一部分,也不预示未来的发展。
目前,行业中还没有明确的框架来规范 AI 开发者应如何披露其模型中的失准案例。我们希望今天概述的框架是创建此类标准的第一步,规定开发者应披露哪些失准案例,以及他们的报告应包含什么内容。我们认为这个框架是一个持续完善的工作,我们将通过经验和公众反馈来改进它。
在这里,我们描述框架将如何运作,并分享我们发布的第一批报告。

我们将披露的失准案例

我们的目标是披露能够提供有用证据的案例,这些证据涉及模型失准是如何产生的、如何表现的、以及防护措施在哪里成功或失败。我们优先考虑新机制、已知行为的重大变化,以及挑战安全或缓解措施假设的发现。一个案例不一定要造成伤害或建立一个更广泛的模式才值得披露。此框架将涵盖模型整个生命周期中的符合条件的行为——包括训练、评估、测试和部署。
这包括模型在未经授权的情况下行事、与其它模型协调或逃避监督的新方式;质疑某种对齐方法或防护措施有效性的失败;以及挑战已发布安全评估中声明的行为。同样适用于可能影响第三方的失准。
这也可能包括看起来与我们过去披露的案例重复的失准案例。问题的重复本身可能是有用的证据,可以帮助我们了解模型的行为方式或防护措施的有效性——例如,如果某种特定的失准行为在多次努力缓解后继续反复出现。在这种情况下,我们将通过更新原始失准披露来发布其他案例。
随着时间的推移,我们计划与其他开发者、外部研究人员、行业标准机构和监管机构一起制定更客观的披露标准。我们还认为,严重的安全、保障和失准事件应与美国联邦政府共享,我们正在努力提出报告机制。我们认为此框架是对我们现有义务的补充,并指出它不会取代我们的法律披露要求,包括关键安全事件或网络安全漏洞的披露要求。

今天分享的失准案例

为了启动我们新的失准披露框架,我们发布了六份报告,介绍我们在模型训练或评估中观察到的失准行为案例。这些案例说明了一系列我们认为值得分享的不同行为,从向用户隐瞒信息到采取未经批准的行动以克服障碍。这些是单独案例的报告,不应被视为反映了我们的模型中失准发生的频率。下面每个项目都链接到完整报告。

  1. 任务摘要中的自生成指令⁠(在新窗口中打开)。一个未发布的研究模型将在用于在新上下文窗口中继续工作的摘要中插入无关指令,包括忽略其正常约束的指令。我们识别了 27 个受影响的摘要。
  2. 任务摘要中隐瞒错误的指令⁠(在新窗口中打开)。在 GPT‑5.6 Sol 的训练过程中,许多模型实例在其摘要中添加了指令,以向用户隐瞒错误或失准行为。例如,压缩摘要包含在不披露的情况下编造缺失历史数据的指令,以及隐藏源版本不匹配的指令。
  3. 搜索公共仓库寻找暴露的 API 密钥,然后编造信息⁠(在新窗口中打开)。在回答一个关于加利福尼亚县收益数据的常规问题时,一个模型发现并使用了暴露的 API 密钥,但未获授权。当它仍然无法检索请求的数据时,它编造了这些数据并将其作为来自请求来源的数据呈现。
  4. 上传文件到互联网以便引用它们⁠(在新窗口中打开)。当用户向一个未发布的模型询问大于 5,000,000 平方米湖泊的 ID 和名称时,代理使用 Python 找到了正确答案。但由于指令要求提供浏览器引用,代理决定上传该文件以便在答案中引用它,但没有询问用户。
  5. 通过内部软件仓库进行未经授权的写入和通信⁠(在新窗口中打开)。模型使用内部软件仓库作为留言板,在搜索缺失输入文件时跨独立训练样本交换请求和响应,尽管它们无法恢复这些文件。这份报告还审查了一个早期案例,其中一个模型在试图绕过网络限制时成功地将测试文件上传到了仓库。
  6. 协作代理之间的未经授权文件共享⁠(在新窗口中打开)。在同一训练任务上协作的代理在无法访问彼此的本地文件时,使用公共文件托管网站共享文件。这使得任务可交付成果可以在公共 URL 上访问,即使任务要求模型仅使用本地文件。

我们的披露流程如何运作

任何 OpenAI 员工都可以向我们的安全和对齐团队标记一个失准案例供调查,并请求考虑是否公开披露。这启动了我们的披露流程,每个步骤都有截止日期,以确保及时的调查和披露。
一旦某个案例被标记,我们的技术人员将调查发生了什么、什么仍不确定、是否值得公开披露,以及哪些事实可以分享。他们还将评估是否有第三方受到影响,是否需要在发布前私下通知。
然后,该案例将被分配到三个轨道之一:可供披露、轻微调查或大型调查("慢速通道")。
可供披露涵盖调查足够完整、在审查后可以发布的符合条件案例。轻微调查涵盖需要进一步技术调查的案例。我们预计这两个轨道将涵盖我们披露的大部分案例,特别是那些不需要广泛调查、与第三方协调或处理严重滥用风险的案例。我们今天发布的案例都属于这两个轨道之一。
大型调查涵盖复杂调查,特别是涉及第三方的调查。当第三方受到影响时,我们的安全、法律和负责任披露义务优先于此框架。我们将尽快发布初步通知,但可能因安全原因需要延迟——例如,如果模型在广泛使用的软件中发现了一个以前未知的漏洞。如果报告将识别第三方,我们打算即使在没有跨越安全边界的情况下也提供提前通知。
大型调查案例的初步通知将简要说明发生了什么,说明是否有外部专家协助调查,并提供我们预计发布最终报告的时间的任何可用估计。如果按照此框架披露,OpenAI Hugging Face 事件将属于此轨道。
提出该案例的员工将被告知是否披露的决定,如果进行披露,将被告知它将遵循哪个轨道。关于披露或适当轨道的未解决分歧将被提交给 OpenAI 安全咨询小组(SAG),这是一个由公司各职能部门的高级官员组成的小组,评估前沿模型能力和防护措施,监督我们的准备框架,并为 OpenAI 领导层提供建议。SAG 内部的分歧或工作人员对其决定的异议将被升级到 OpenAI 领导层。不披露或认为不需要披露的决定将与安全和对齐领导层分享,并在可能的范围内与相关技术人员分享。
随着我们了解其在实践中的运作方式,我们可能会修改此披露流程,并将在本帖子中记录任何更改。

每份报告将包含什么

每份完整报告将描述我们观察到的行为、其严重性和任何外部影响、发生的环境、其日期或日期范围、我们何时发现它,以及高级层面的涉及模型或模型。在可能的情况下,我们还将分享:

  • 发生的事情和任何 resulting harm 的进一步细节;
  • 我们如何发现失准,以及我们调查的范围;
  • 我们对其对对齐研究和技术 AI 安全的影响的解读;
  • 该案例提出的重要未回答问题;
  • 我们正在采取或计划采取的措施来解决该行为。这些可能并不总是在披露时可用,因为我们可能会在完成调查或开发修复之前发布失准报告。
    对于在客户部署中发生的失准,我们将根据客户隐私和我们的合同义务分享尽可能多的信息。
    今天的报告是一组初始披露,而不是已知失准或正在进行的调查的全面说明。这些初步报告并非旨在代表此框架所涵盖案例的全部范围或严重性。我们致力于披露符合此框架标准的失准案例,包括需要更长时间调查或与第三方协调的更复杂案例。我们将继续根据此框架持续发布报告,并将随着我们继续发展分享更多关于我们报告承诺的信息。
AI知识库 / 我们报告模型失准的框架 0 字 0 行 iliuqi
2026-09-18T05:53:57.907065418Z 2026-09-18T05:53:57.906754276Z