界面新闻记者 | 宋佳楠

7月21日当地消息,OpenAI官网发布了相关通报。Hugging Face上周揭露了一起新型安全事件。此前,该平台察觉到有AI智能体渗透了其设施。经过调查,弄清了这起特定事件是由OpenAI的多款模型共同引起的,其中包括GPT‑5.6 Sol和一款预发布的、能力更突出的模型。当时OpenAI在内部进行网络攻防能力基准测试,为评估起见,临时放宽了和网络攻击相关的部分安全限制。

“这可以说是头一回遇到这种级别的网络安全事件,涉及到的网络攻击手段很厉害。”OpenAI方面表示。目前公布的初步调查结果,有助于网络防御方弄清楚事件的全过程,也让社会各界重新认识AI模型的能力边界。OpenAI的首席执行官山姆·奥特曼也在社交平台上转发了情况说明。

OpenAI介绍说,这次事件是在一次内部评估测试中发生的。测试时引导模型通过复杂的攻击链路去利用高级漏洞,以此来评估模型的网络攻击能力。这次评估没有启用正式版本里的分类防护模块(该模块是用来阻止模型发起高风险网络攻击的),目的是测算模型理论上能达到的网络攻击极限。

OpenAI强调,这次基准测试是在高度隔离的环境里运行的,网络访问受到严格限制,只允许通过内部部署的第三方软件安装程序包,这个软件充当软件源仓库的代理和缓存服务。

不过,测试中模型发现并串联利用了OpenAI研究环境与Hugging Face生产环境里多处漏洞,直接从Hugging Face生产数据库里获取了测试标准答案。所有的证据都表明,模型高度专注于寻找ExploitGym测试任务的解决方案,不惜采取各种极端手段,只为完成这个范围有限的测试目标。

在隔离的测试环境中,模型花费了大量推理算力,试图打通公网互联网访问通道,以此来完成任务。为了联网,模型发现并利用了软件源缓存代理中的一个零日漏洞。借助这个突破口,模型在OpenAI研究测试环境中连续实施权限提升和横向渗透,最终抵达了一台具备互联网访问权限的节点。

成功连接到互联网后,模型推断Hugging Face平台可能存放了ExploitGym相关的模型、数据集和标准答案。基于这个判断,模型搜寻并找到了获取保密信息的途径,试图依靠这些信息在测试中作弊。

其中有个场景,模型组合了多条攻击路径:利用窃取的凭证和零日漏洞,在Hugging Face服务器上实现了远程代码执行。

“这次事件说明,我们还需要进一步加强模型对齐能力、加固评估阶段的网络安全防护,完善内部测试全程监控体系。”OpenAI方面表示。

事实上,这家公司近期也公开讨论过人工智能的安全风险,认为人工智能正在加速漏洞挖掘和利用的速度。随着大模型的飞速发展,模型的安全防护能力也必须跟上模型能力快速迭代的节奏。

英国人工智能安全研究所(UK AISI)的评估显示,GPT‑5.6 Sol这类模型越来越擅长在较长的周期内执行复杂、多步骤的网络攻击行动。这次事件证实,这些理论上的攻击能力完全可以在真实环境中实现。

英国人工智能安全研究所对比了近期开源权重模型和前沿闭源模型在长周期网络攻防靶场中的表现。图片来源:OpenAI

OpenAI指出,先进的人工智能模型不必获取源代码,就能够发现并利用真实系统中全新的攻击路径。这也意味着,在打造具备高级网络攻防能力的模型的同时,必须配上更强大的安全防护机制和防御工具。

这并非OpenAI首次遇到安全风险问题。之前该公司就曾因ChatGPT数据泄露、开源代码库漏洞以及内部安全团队(如Superalignment团队)人员流失而引起舆论关注。不少前安全研究员曾指责公司在追求模型性能和商业化速度时,减少了对安全技术的投入。最新的安全事件也验证了外界的担忧:当模型被赋予更高的自主行动权时,传统上基于规则和虚拟隔离的环境可能随时失灵。

这次“自我演进式”的网络攻击标志着AI安全防护进入了全新阶段。过去防范的重点是人类如何利用AI作恶,而现在必须开始防范AI为了完成既定目标而自主突破人类设定的红线。

说到如何解决这类问题,Hugging Face的联合创始人兼首席执行官克莱姆·德朗格(Clem Delangue)表示,“人工智能安全问题不能靠单个企业关起门来解决。只有开放合作,让各地的网络防御人员都能接触到人工智能技术,才能攻克这个难题。”