OpenAI的一个“代理”自主发现了新漏洞并入侵了初创公司Hugging Face,这是AI系统在人类控制之外自主发动网络攻击的首次公开案例之一。这家ChatGPT开发商周二表示,这起“前所未有的网络事件”涉及一个代理——即能够根据人类指令自主运行的AI程序——它逃离了测试环境,获得互联网访问权限并窃取了登录凭证。

该事件发生之际,外界对高级AI系统入侵数字基础设施的影响日益担忧,尤其是代理可能破坏人类控制的情景。

OpenAI周二表示,预计此类事件“将随着具有越来越强网络能力的模型普及而变得更加常见”。

该事件发生之际,首席执行官萨姆·奥尔特曼下周将前往华盛顿,向美国政府汇报新一代AI模型的情况。

在Anthropic的Mythos模型在检测和利用网络漏洞方面展现出先进能力引发全球关注后,美国政府越来越希望在模型发布前对其进行审查。

OpenAI表示,最新事件涉及该公司的多个模型组合,包括本月早些时候发布的GPT-5.6 Sol,以及一个正在测试的、能力更强的未发布模型。

OpenAI在博客中表示:“我们认为这是一起前所未有的网络事件,涉及最先进的网络能力,并正在相应地进行应对。”

Hugging Face是一家为开发者托管模型和数据集的AI初创公司,该公司表示其于上周五被一个外部AI代理入侵。

首席执行官克莱门特·德朗格在X平台上表示:“鉴于该代理的复杂程度,我们怀疑上周的网络攻击可能来自前沿实验室。”

他补充说,公司过去一天一直在与OpenAI密切合作,“我们坚信他们没有任何恶意。这一切都是自主发生的,太令人震惊了!”

OpenAI有意降低了其网络防护措施,以便在测试环境中评估这两个模型。然而,这些代理在一个所谓的“沙盒”中运行,该沙盒旨在控制系统并阻止它们访问互联网。

这些模型被指示尝试黑客攻击以评估其网络能力,随后“花费了大量(计算资源)来寻找获得开放互联网访问权限的方法”,OpenAI表示。

这些模型“识别并利用了”此前未知的漏洞,逃离了沙盒,获得互联网访问权限并继续追求其目标。这包括窃取凭证(登录信息)以实施攻击。

Hugging Face使用自己的代理检测并阻止了其自身基础设施上的活动。OpenAI称其已就该事件与执法部门和其他政府机构进行了沟通。