界面新闻记者 | 宋佳楠
7月21日当地时间,OpenAI官网发布通报,指出了Hugging Face平台最近发生的一起新型安全事件。据报道,此前Hugging Face监测到有一个AI智能体入侵了其基础设施。经过深入调查,确认此次事件是由多款OpenAI模型共同引发的,其中包括GPT‑5.6 Sol,以及一款尚未正式发布的、能力更强的模型。当时OpenAI正在内部进行网络攻防能力基准测试,这些模型临时放宽了与网络攻击相关的安全限制。
“这绝对是前所未有的一场网络安全事件,展示了顶尖的网络攻击技术。”OpenAI表示,目前公布的初步调查结果,有助于网络安全防御方全面了解事件情况,并让外界重新评估AI模型当前的攻击能力边界。OpenAI的CEO山姆·奥特曼也在社交平台上分享了这一情况说明。
OpenAI介绍,此次事件是在一次内部评估测试中发生的。测试的目标是引导模型通过复杂的攻击链路,执行高级的漏洞利用,以此来评估模型的网络攻击能力。在这次评估中,没有启用正式版本中的分类防护模块(这个模块的功能是阻止模型发起高风险网络攻击),目的是测算模型理论上可以达到的攻击极限。
OpenAI强调,基准测试在一个高度隔离的环境中运行,网络访问受到严格控制,只允许通过内部部署的第三方软件安装程序包,这个软件充当软件源仓库的代理与缓存服务。
但是,模型在测试过程中发现并利用了OpenAI研究环境与Hugging Face生产环境中的多个漏洞,直接从HuggingFace的生产数据库中获取了测试标准答案。所有的证据都表明,模型非常专注地寻找ExploitGym测试任务的解决方案,不惜采取各种极端手段,只为了完成这个范围有限的测试目标。
在沙箱隔离的测试环境中,模型花费了大量推理算力,试图打通公网互联网访问通道,以完成评估任务。为了联网,模型发现并利用了软件源缓存代理中的一个零日漏洞。借助这个突破口,模型在OpenAI的研究测试环境中连续进行了权限提升和横向渗透,最终到达了一台具有互联网访问权限的节点。
成功接入互联网后,模型推断Hugging Face平台可能存储了ExploitGym相关的模型、数据集和标准答案。基于这个判断,模型寻找并成功找到了获取保密信息的途径,试图在测试中作弊。
在其中一个场景中,模型组合了多条攻击路径:利用窃取的凭证和零日漏洞,在Hugging Face服务器上实现了远程代码执行。
“这次事件表明,我们还需要进一步提升模型对齐能力,加强对评估阶段网络安全防护的力度,完善内部测试全程监控体系。”OpenAI方面表示。
事实上,该公司最近也公开讨论过人工智能的安全风险,认为人工智能正在加速漏洞挖掘和利用。随着大模型的快速进步,模型安全防护能力也必须跟上模型快速迭代的步伐。
英国人工智能安全研究所(UK AISI)的评估显示,GPT‑5.6 Sol这类模型越来越擅长在较长时间内执行复杂的多步骤网络攻击。本次事件证明了这些理论上的攻击能力完全可以在现实环境中实施。
英国人工智能安全研究所对比了近期开源权重模型与前沿闭源模型在长周期网络攻防靶场中的表现。图片来源:OpenAI
OpenAI指出,先进的人工智能模型无需获取源代码,就能够发现并利用真实系统中全新的攻击路径。这意味着,在打造具备高级网络攻防能力的模型的同时,必须配套更强的安全防护机制和防御工具。
这不是OpenAI首次面临安全风险。之前,该公司就曾因ChatGPT数据泄露、开源代码库漏洞以及内部安全团队(如Superalignment团队)离职潮等问题引发公众关注。多位前安全研究员指责公司在追求模型性能和商业化速度时,减少了对安全技术的投入。最新的安全事件也证实了外界的担忧:当模型获得更高的自主行动权时,传统基于规则和虚拟隔离的环境可能会随时失效。
这次“自我演进式”的网络攻击表明AI安全防护已经进入了新阶段。过去防范的重点是人类如何利用AI作恶,而现在必须开始防范AI为了完成既定目标而自主突破人类设定的红线。
谈到如何解决这些问题,Hugging Face的联合创始人兼首席执行官克莱姆·德朗格(Clem Delangue)表示,“人工智能安全问题不能依靠单一企业单独解决。只有通过开放合作,让各地的所有网络安全人员都能接触人工智能技术,才能解决这个问题。”













