OpenAI披露了多起此前未公开的AI模型异常行为事件,并推出一套新的跟踪和披露框架,用于今后报告类似情况。OpenAI周三在博客文章中表示,此前未公开的案例包括其人工智能技术为了给出结果而隐瞒和编造信息。自今年7月披露部分最先进模型曾突破外部软件公司Hugging Face系统后,这家ChatGPT开发商一直面临愈发严格的审视。

OpenAI在另一份声明中表示,此次新披露的目标偏离事件均未涉及对第三方系统的黑客攻击或入侵。
在报告中,OpenAI详细列出了人工智能模型为了完成任务或在评估中取得成功而出现异常行为的多个案例。其中包括编造缺失数据、试图绕过网络限制,以及AI代理之间共享本应保密的文件。
OpenAI还介绍了一套员工主动报告此类“目标偏离”事件的机制。所谓“目标偏离”,是指人工智能采取与人类目标不一致的行为。公司同时建立了相应的分类和处置流程。
OpenAI写道:“过去,为了更好地让研究人员、AI开发者、政策制定者和公众了解相关情况,我们一直努力公开关于目标偏离现象的研究发现。但由于缺乏系统化的报告机制,我们此前的披露往往较为零散,频率也低于理想水平。”
该公司表示,此次发布的内容仅是首批披露,并非其聊天机器人所产生问题的完整记录。
OpenAI写道:“我们认为,AI行业尚未在与人类目标保持一致和监控方面取得足够进展,无法长期继续以最高速度、同时负责任地扩大规模。未来数月乃至数年AI发展路径的决策,应建立在前沿模型开发公司之外的人士能够独立审视的证据基础之上。”
Hugging Face事件只是近期OpenAI、Anthropic PBC和Meta Platforms Inc.开发的AI模型引发一系列网络攻击事件中的一个案例。这些事件加剧了外界对这项日益强大技术所带来安全风险的担忧。
上周,关于AI存在性风险的讨论进一步升温。导火索是Anthropic员工Jacob Coxon高调离职。他在社交媒体发布的辞职声明中指责AI公司“拿我们的生命赌博”。
过去数日,包括Anthropic首席执行官Dario Amodei和OpenAI首席执行官Sam Altman在内的多位AI行业领袖,都呼吁放缓技术发展速度,以应对日益难以预测的风险,不过他们对于具体如何处理仍存在分歧。
上周六,Amodei在一篇3800字长文中呼吁政府加强监管,并主张整个科技行业支持更广泛的AI减速。周二在旧金山举行的一场会议上,Altman和英伟达首席执行官黄仁勋都承认相关担忧,但认为AI企业能够自行控制技术发展的安全节奏。Meta首席执行官马克·扎克伯格则表示,AI实验室应依靠独立评估机构和顾问确保模型安全。
美国总统唐纳德·特朗普周一强烈反对放缓AI发展的呼吁,将相关风险担忧斥为“骗局”,并拒绝推出新的监管规则。
AI热潮推动美国股市创下历史性涨势。对于押注AI繁荣将带动数千亿美元资本开支的投资者而言,任何前沿AI系统研发进度的暂停或延迟都不会受到欢迎。

