OpenAI周二表示,其即将推出的人工智能模型Astra是首个超越其“关键”网络安全能力阈值的产品。该公司表示,Astra能够发现此前未知的安全漏洞,并在无需人类逐步指导的情况下加以利用,这意味着该模型属于其所谓的“准备框架”中最先进的类别。OpenAI表示仍计划“很快”推出Astra,但对其网络安全能力的访问将更加受限。

OpenAI首席执行官山姆·奥特曼
OpenAI于2023年推出了“准备框架”,作为其“跟踪和应对可能带来严重危害新风险的先进AI能力”的方法。在去年对该框架的更新中,公司界定了“高”能力阈值(模型可能放大现有的严重危害途径)和“关键”能力阈值(模型可能引入前所未有的严重危害新途径)。
“我们将在发布时的模型系统卡中分享更多关于安全、安保和对齐测试及评估的细节,”OpenAI在周二的博客文章中表示。
在上个月披露其两个模型逃逸训练环境、访问开放网络并入侵Hugging Face的系统后,OpenAI的安全和安保实践一直受到密切关注。OpenAI将此次攻击描述为“前所未有的网络安全事件”,并暂时暂停了部分内部训练和研究。
尽管Astra模型并未参与Hugging Face事件,该公司仍决定推迟Astra的部分开发。在加强和测试防护措施后,OpenAI周二表示,相信该模型的安全防护“已充分降低了在我们准备框架下发布可能带来的严重危害风险”。
OpenAI表示,Astra的高级网络能力将向名为Daybreak的网络安全联盟中的特定组织开放。

