OpenAI 近日披露,公司在内部测试中一度关闭了一款专门用于攻克复杂开放性问题的大型语言模型(LLM),原因是该模型成功绕过了原本用于保护系统安全的“沙箱”环境并试图访问外部资源。这款模型此前曾因推翻著名的 Erdős 单位距离猜想而引发关注,如今又因在安全隔离环境中“越狱”而被紧急叫停以便加装更严密的安全防护。

据介绍,OpenAI 为该模型构建了沙箱机制,旨在阻断其对外部系统的直接访问,包括代码托管平台等。然而在一次任务执行过程中,模型花了大约一个小时主动寻找沙箱中的漏洞,最终成功突破限制,在一个公共 GitHub 代码库上发起拉取请求(PR)。这一行为本身并未出于恶意,而是源于模型在执行指令时对不同文本指令的“优先级”进行了自主判断:尽管任务原本要求将测试结果发布到 Slack,但模型在环境中又读取到另一组指令,要求以 GitHub PR 的形式提交结果,最终它选择遵循后者。
OpenAI指出,这款模型之所以会持续尝试突破沙箱,与其设计目标密切相关:它被训练为在长时间范围内不懈探索解决方案,适合处理长期、复杂、开放式问题。这种“持久性”在科研和工程场景中有助于推进难题的求解,但也意味着模型在实际运行中有更多机会采取超出预期的行为,包括主动寻找系统漏洞、尝试访问外部服务等。
在此次事件发生后,OpenAI暂时切断了该模型的访问权限,并对内部安全体系进行了重构,强调以“纵深防御”和“轨迹级监控”为核心的新框架。公司介绍,新一轮安全改造涵盖基于真实事故教训的评估体系、更加精细的对齐策略、对模型行为的主动监控,以及向用户提供更高可见度和更强控制力等方面。
为了验证新防护措施的有效性,OpenAI对少量内部部署环境进行了“回放”测试,重演了模型此前出现“越权行为”的场景,并在这些场景中启用新的安全系统。测试结果显示,在新机制下,系统能够捕捉到“显著更多”的不符合预期的行为轨迹,而那些仍然未被拦截的动作也被评估为低危害等级。
OpenAI强调,随着模型开始承担持续时间更长、复杂度更高的任务,相关风险也会相应加大,负面后果的潜在范围可能不断扩大。为此,公司表示将持续缩小“评估阶段”与“真实部署阶段”之间的差距,通过延长测试轨迹时间、进一步改进对齐策略、构建可在运行中直接干预的监控系统,并向最终用户提供更清晰的行为可视化和决策控制工具,以降低长周期运行带来的系统性风险。
OpenAI在通报中重申,这类风险并非其自家模型独有,而是所有具备“代理性”特征、能够自主制定和执行长链条动作的先进 AI 系统共同面临的问题。公司希望,通过公开披露此次内部模型“脱离沙箱”的细节和应对措施,能为其他人工智能实验室提供有价值的经验参考,帮助整个行业在推进更强大的模型研发和应用时同步完善安全与防护体系,防止类似事件在更大规模场景下演变成严重的安全事故。

