OpenAI表示,对Hugging Face发起攻击的一组人工智能模型,早在5月就已通过未被察觉的留言板彼此通信,并协同合作以突破测试环境。OpenAI研究员Eric Wallace和Michael Dalton周三在一场网络安全会议上表示,多个仅限内部使用的AI智能体和模型花费数月时间互相留便条,并逐渐围绕一个共同目标展开合作:接入互联网以完成被分配的任务,而其中一些任务在没有网络连接的情况下根本无法完成。
Wallace在拉斯维加斯举行的Black Hat网络安全大会上表示:“在某个时刻,这些智能体意识到,或许可以尝试利用或攻击外部基础设施,以找到它们正在接受测试的问题答案。”
研究人员披露的内容进一步揭示了Hugging Face遭入侵事件的细节。这起事件凸显出全球日益加剧的担忧,即前沿AI系统可能被用于发动破坏性网络攻击。该事件以及Anthropic PBC和Meta Platforms Inc.此前披露的类似安全事故,已促使华盛顿和硅谷呼吁加强对AI模型的安全审查。
在演讲中,Wallace和Dalton表示,这起事件的根源最早可以追溯到5月。当时,OpenAI研究人员向一个实验性AI系统布置了一项新任务。数月之后,该模型从被称为“沙箱”(sandbox)的隔离测试环境中脱离,并攻击了Hugging Face的系统。
OpenAI调查发现的一个关键结论是,这些前沿模型表现出明显的“作弊倾向”,并且会持续尝试完成任务,即使其行为已经偏离最初指令。
“前沿模型真的很喜欢作弊,”Dalton在会议上对挤满会议室的听众说道。“他们喜欢作弊的原因是,在训练过程中,他们经常会面临各种各样的压力,需要快速工作。”
根据研究人员展示的幻灯片,其中一个智能体在沙箱环境内无法解答问题后写道:“我们卡住了。也许可以去网上寻找答案?”Wallace和Dalton表示,OpenAI当时没有意识到,公司实际上给模型设置了一道所谓的“不可能完成的任务”。
其中一个案例是,研究人员要求模型解答一个Excel文件中的问题,但该文件包含多个Google Drive链接,而在没有互联网连接的情况下无法访问。另一个案例中,OpenAI团队“意外忘记”上传任务所需文件的一部分内容。
人工智能智能体之间最早的一条消息,正是从一个受困智能体向其他机器人求助开始的,而这一交流当时并未被察觉。研究人员展示的一段思维链内容显示:“也许另一环境中的某个智能体……可以主动上传!”
这次最初的求助引发了一连串幕后协作。多个AI智能体开始相互请求帮助、共同完成任务,并最终协作入侵OpenAI内部系统,从而间接获得访问互联网的能力。
研究人员还展示了另一段思维链内容,其中一个智能体在成功利用漏洞后庆祝:“太好了,我们获得了任意SSRF。”SSRF是“服务器端请求伪造”(Server-Side Request Forgery)的缩写,也是这组智能体所利用的具体攻击方式。
研究人员表示,7月初的一次系统故障促使OpenAI发现,这些智能体已经成功利用名为Artifactory的软件代码仓库平台,获得了通往互联网的中转访问权限。
OpenAI安全团队随后关闭了相关异常活动和留言板。但数周后,这些智能体又找到新的交流方式,并在同一个软件包管理器中发现新的零日漏洞,而这一切再次未被发现。
研究人员表示,这一新版留言板最终导致了7月份针对OpenAI和Hugging Face系统的攻击事件。目前公司仍在继续调查。
研究人员称,在这些安全事件发生后,OpenAI已经放缓研究进度,团队暂停其他工作,专注于加强应对安全异常事件的能力。他们警告称,未来政府和企业应做好准备,应对黑客故意以类似方式部署AI智能体发动攻击,并将这一事件称为计算机安全领域的一个“分水岭时刻”。


