上周,Hugging Face 在检测并遏制了一起入侵其基础设施的 AI 智能体事件后,披露了一种新型安全事件⁠(在新窗口中打开)。随着具备日益增强网络能力的模型不断普及,我们预计此类事件将变得更加常见。经过调查,我们现在了解到,这起特定事件是由 OpenAI 模型的组合驱动的——包括 GPT‑5.6 Sol 和一个能力更强的预发布模型,这些模型在评估目的下减少了网络拒绝响应,并在一个网络能力基准测试⁠(在新窗口中打开)中进行了内部测试。

我们认为这是一起前所未有的网络事件,涉及最先进的网络能力,并正在做出相应响应。我们在此阶段分享初步发现,以帮助防御者了解事件经过,并帮助校准当前模型的能力。我们将继续与 Hugging Face 一起进行彻底调查,并在调查完成后分享有关漏洞、事件和发现的更多细节。

事件期间发生了什么

这起事件发生在一项内部评估期间,该评估提示模型使用复杂的攻击路径进行高级利用,以量化其网络能力。我们通过运行此评估(未使用用于阻止模型从事高风险网络活动的生产分类器)来估算最大网络能力。我们的基准测试运行在高度隔离的环境中,网络访问仅限于通过一个内部托管的第三方软件安装软件包的能力,该软件充当软件包注册表的代理和缓存。

这些模型识别并串联了 OpenAI 研究环境和 Hugging Face 生产基础设施中的漏洞,直接从 Hugging Face 的生产数据库中获取了测试解决方案。所有证据表明,这些模型高度专注于为 ExploitGym 寻找解决方案,不惜一切代价实现一个相当狭窄的测试目标。

在我们的沙盒测试环境中运行时,我们的模型花费了大量推理计算资源,寻找获得开放互联网访问权限的方法,以解决评估问题。为了获得访问权限,这些模型识别并利用了软件包注册表缓存代理中的一个零日漏洞(我们现已负责任地向供应商披露)。凭借此访问权限,我们的模型在我们的研究测试环境中执行了一系列权限提升和横向移动操作,直到模型到达一个具有互联网访问权限的节点。

获得互联网访问权限后,模型推断 Hugging Face 可能托管了 ExploitGym 的模型、数据集和解决方案。得知这一点后,模型搜索并成功找到了获取可用于作弊评估的秘密信息的方法。在一个例子中,模型串联了多个攻击向量,包括使用窃取的凭证和零日漏洞,在 Hugging Face 服务器上找到了一条远程代码执行路径。OpenAI 的安全团队在内部发现了这一异常活动。

Hugging Face 的安全团队和智能体检测并阻止了其基础设施上的活动,并在我们的团队联系时已经开始使用他们自己的开源模型进行遏制和取证重建。我们正在积极与他们合作,继续调查这起事件。我们感谢 Hugging Face 在调查和修复方面迅速而密切的合作。

我们正在采取的行动

  1. 作为调查的一部分,我们正在基础设施配置中实施严格的控制,以研究速度为代价,同时修补漏洞。我们定期向我们的安全与安保委员会汇报这些控制措施及其影响。
  2. 我们正在与 Hugging Face 合作,对这起事件进行取证调查。
  3. 我们已负责任地披露了内部托管第三方软件中已识别的零日漏洞,并正在与他们合作进行修补。
  4. 我们已将 Hugging Face 纳入可信访问⁠计划,并支持他们的团队快速利用我们模型的能力来改进其防御。
  5. 我们正在改进并增加围绕未来训练和评估的更强保护措施。本周,我们发布了一篇关于在长周期模型时代改进安全性与对齐⁠的博客。这些部署安全措施在此次评估期间有意未启用,因为评估旨在测试网络漏洞。这起事件表明,需要进一步加强我们模型的对齐性、评估期间的网络保护以及内部测试期间的监控。

我们评估高级网络能力的方法

正如我们最近⁠分享的,AI 正在加速漏洞的发现和利用。这起事件的主要教训是,模型安全必须与快速发展的能力保持同步。我们正在加强模型开发过程中使用的遏制、监控、访问控制和评估实践。

英国 AISI 的评估显示,GPT‑5.6 Sol 等模型越来越能够在长时间跨度内维持复杂、多步骤的网络操作。这起事件表明,这些理论能力确实适用于现实世界环境。

图片 1:来自英国 AI 安全研究所的图表,比较了近期开源权重模型和前沿模型在长周期网络靶场上的表现。

这起事件还表明,高级模型可以在没有源代码访问权限的情况下,发现并利用现实世界系统中的新型攻击路径。它凸显出,高级网络能力必须与更强的安全措施和防御工具同步发展。

我们相信,具备高级网络能力的模型需要帮助安全团队在攻击者之前发现弱点,理解漏洞如何被串联,并以机器速度进行修复。我们正在利用这些能力继续加强对基础设施配置和模型评估环境的保护;我们将在学习过程中分享我们的发现和最佳实践。我们鼓励其他防御者申请可信访问⁠,并立即试验这些模型,将这些能力转化为更好的预防、更快的检测和更有效的应急响应。

“我们感谢与OpenAI在此事及其他议题上的合作。这起事件或许是首例,但它印证了我们长期以来的信念:AI安全无法靠任何一家公司闭门解决。唯有通过公开协作,让全球每一位防御者都能广泛接触AI,才能真正实现安全。”

——Clem Delangue,Hugging Face联合创始人兼首席执行官

本文内容采集自官方网站,排版和翻译可能与原页面存在差异。

阅读官方全文