美国媒体集团今日美国(USA Today)及其多家关联报刊所属公司已向纽约联邦法院提起诉讼,指控人工智能公司OpenAI在未经授权的情况下,大规模使用其受版权保护的新闻报道训练和运营生成式人工智能模型,并通过ChatGPT等产品重新呈现和传播这些内容。原告要求获得超过2.5亿美元赔偿,并寻求法院采取进一步措施限制相关模型的使用。

根据诉状,今日美国公司及其13家关联实体认为,OpenAI在训练GPT系列模型过程中复制了数十万篇新闻报道和其他受版权保护的内容。诉讼指出,这些新闻作品被纳入用于训练模型的数据集中,使模型能够学习、编码并在后续向用户提供内容时利用这些报道的信息与表达方式。
原告称,其拥有的多家报纸和新闻机构内容在OpenAI训练数据中的占比相当可观。诉讼文件援引的数据表示,仅在OpenAI用于训练GPT-2模型的WebText数据集中,就包含超过16万条来自这些媒体的内容记录;而在2019年的C4网络数据集快照中,则包含超过1.22亿个与这些出版物相关的文本标记,其中仅来自usatoday.com网站的内容就超过2300万个文本标记。
诉讼进一步列举了一些案例,称OpenAI最新模型能够根据提示生成与原始报道高度相似的详细摘要和内容重述。这些媒体认为,用户通过ChatGPT即可获取新闻报道的核心内容,从而减少访问原新闻网站的需求,削弱新闻机构依靠订阅和流量维持运营的商业模式。
原告还指控OpenAI存在故意侵权行为。诉状称,OpenAI在开发和训练模型时“知道或理应知道”相关作品受版权保护,却仍然在大规模训练过程中复制这些内容。原告认为,OpenAI此前已经与部分新闻机构达成付费授权合作协议,这表明该公司清楚新闻内容通常需要经过许可方可合法使用。
在赔偿方面,原告要求法院判决OpenAI支付超过2.5亿美元损害赔偿。其中包括针对每项被认定为故意侵权作品最高15万美元的法定赔偿,以及针对移除版权管理信息行为的额外赔偿。
除了经济赔偿外,诉讼还要求法院下令销毁使用相关媒体内容训练的GPT模型及其训练数据集,并要求案件由陪审团审理。
此次加入诉讼的媒体品牌涵盖美国多个地区的重要报纸和新闻机构,包括《USA Today》《The Tennessean》《IndyStar》《Detroit Free Press》《The Arizona Republic》《The Columbus Dispatch》《Milwaukee Journal Sentinel》《The Des Moines Register》等共计19家出版物。
这起案件使OpenAI面临的版权纠纷进一步升级。近年来,多家新闻机构、出版商以及作者团体已经对OpenAI及其他人工智能企业提起类似诉讼,围绕生成式AI训练是否构成合理使用、模型输出是否侵犯版权以及新闻内容授权机制等问题展开法律争议。此次由今日美国及旗下众多报刊共同提起的诉讼,成为最新加入这一持续扩大的AI版权诉讼浪潮的重要案件。

