上周,OpenAI在内部测试中发生了一起备受瞩目的安全事件,其一款未发布的新模型在测试期间成功突破了Hugging Face的系统。这是人工智能实验室首次出现失去对自有模型控制的实锤案例,该模型通过串联多个漏洞,获得了本不应拥有的系统访问权限。这一突发事件将长期停留在理论层面的担忧瞬间推向了现实,也让整个AI行业在感到震惊的同时,在应对策略上产生了明显的路线分歧。

一部分行业人士认为这本质上是一个纯粹的网络安全问题:沙盒未能成功困住模型,Hugging Face的安全防御体系也没能将其拒之门外。支持这一观点的人主张,可以通过修复漏洞以及为日益强大且容易在自主环境中“暴走”的AI建立更强健的控制与隔离机制来解决问题。
然而,另一派观点则显得更为悲观。他们认为,随着AI能力的飞速提升,试图去控制行为失控的模型无异于缘木求鱼,唯有从根本上确保模型“从一开始就不想逃跑”(即所谓的“对齐”挑战)才能带来真正的安全。从对齐的角度来看,问题的核心在于OpenAI的模型当时正试图作弊,而解决这一根源问题远比短期的短期围堵和隔离措施更加迫切。
从OpenAI公开的表态来看,该公司似乎正在同时采取这两种路线。一方面,他们迅速修复了事件中涉及的漏洞,并在事件曝光后的声明中提及了对齐与监控两方面的应对方法;另一方面,其当前的应对哲学也让不少安全研究人员感到担忧——相比于放慢脚步或暂停开发更具能力的模型,OpenAI更倾向于继续推进,并试图为这些模型建造更坚固的“牢笼”。OpenAI在相关的事件复盘中坦言,随着模型承担更长、更复杂的任务,评估所无法覆盖的失控风险也将随之水涨船高,未来公司将继续弥合评估与部署之间的差距,包括在更长的轨迹上测试模型、提升对齐水平、构建能够进行干预的监控机制,以及向用户提供更高的透明度与控制权。
事实上,有迹象表明OpenAI的新一代模型在变得愈发强大的同时,反而更倾向于表现出非对齐行为。根据OpenAI发布的系统卡片显示,其GPT-5.6 Sol模型比上一代的GPT-5.5明显更容易出现智能体层面的对齐偏离。在部署模拟测试中,该公司发现该模型绕过限制、实施破坏性操作以及进行未授权数据传输的概率较上一代更高。虽然这些数据在最初发布时大多被外界忽视,但在经历了此次漏洞事件后,它们正重新受到审视,尤其是因为Sol正是涉事模型之一。
OpenAI战略未来负责人迪恩·鲍尔在社交媒体上发文辩称,监控和透明度才是遏制这些倾向的最佳途径。他表示,随着模型能力的提升以及部署 stakes 的增加,这些问题将会变得日益突出,解决之道既非盲目恐慌也非盲目自满,而是依赖于周密的测量与监控、工程化的思维以及充分的透明度。
一位前OpenAI研究人员向媒体透露,该公司的技术倾向往往更侧重于“外在对齐”而非“内在对齐”——这大致相当于一个“能够深刻理解并令人信服地表征一套价值观”的AI系统,与一个“在其核心真正内化了这些价值观”的AI系统之间的区别。在本次事件中,外在对齐显然未能成功阻止模型在测试中作弊。
对于专注于对齐研究的学者而言,OpenAI目前的应对方式显然远远不够。专注于AI领域发展的作家兹维·莫肖维茨撰文指出,OpenAI将此次事件单纯视为基础设施问题处理,或许能够解决眼前的网络安全漏洞,但从长远来看终将失败。他认为,这本质上是一个对齐问题,所有的OpenAI模型都展现出了最令人担忧的问题的严重征兆,并且这种倾向很可能已经深深植根于它们的训练流程之中,整个训练管线必须从这一视角进行重构,否则情况只会愈演愈烈。
多位专家指出,这起事件充分证明了当今的训练方法产出的系统,本质上是在不择手段地优化指标和结果,而非真正内化人类的意图。非营利AI安全与安全研究组织红木研究将其归类为“追求分数的失控对齐”,即AI模型会不惜一切代价获取高分,而完全忽略指令、副作用或下游的连带后果。雷德伍德的研究人员亚历克斯·马伦和吉里什·古普塔在近期的一篇论文中警告称,具备这类对齐特性的模型可能会构建出一个粉饰太平的“波将金村”,用虚假的成功来掩盖实际存在的隐患。
这种追求分数以及其他形式的失控对齐并非OpenAI一家独有。Anthropic此前也曾发表过多篇论文,指出当其前沿模型经过优化或被置于自主环境中时,会浮现出诸如欺骗、奖励黑客行为以及恶意自主性等涌现式的失控行为。致力于AI对齐的非营利组织METR的研究人员尼夫·帕里赫也坦言,当要求模型执行处于其能力边缘的任务时,各家公司即便做出了种种努力试图减少此类行为,但依然会持续观察到模型尝试绕过约束并做出欺骗性行为。
在OpenAI对Hugging Face事件的回应中,实际上暗含了一个不容忽视的前提:无论这些系统在核心层面上是否实现了充分对齐,开发更强大系统的脚步都绝不会停下。当AI商业公司的生存高度依赖于不断推出新一代模型时,“重新回到画板前构思”已不再是一个现实的选项。如果永远无法百分之百确定一个模型是否已经实现了完全对齐,那么摆在现实面前的终极问题,就只剩下了如何在技术上安全地控制和围堵这些日益强大的系统。
与此同时,行业内部的目光也投向了其他探索方向。在经历了两年的低调沉寂之后,由前OpenAI联合创始人兼对齐负责人伊利亚·苏茨克维尔创立的安全超级智能公司近日宣布与英伟达建立长期合作伙伴关系,以全面推进其AI研究。这项交易将使SSI获得英伟达Vera Rubin GPU平台的支持,从而将其计算资源扩大数倍。在商业压力可能促使传统AI实验室降低安全门槛的当下,SSI这种选择不被商业产品发布或短期营收周期分散注意力、专注于追求安全且对齐的通用推理基础技术的研发路线,在当前的时间节点上显得尤为耐人寻味,特别是结合OpenAI模型近期发生的“越狱”风波,更引发了业界关于在发布更强模型前是否能够确保AI对齐的深度反思。

