有调查披露,亚马逊等科技公司正将大量珍稀藏书送往隐秘仓库进行集中销毁,其唯一目的是为大型语言模型(LLM)提供未经污染的全新训练数据。在人工智能生成内容泛滥的当下,这一极端行为正引发外界对文化遗产流失的深切担忧。

随着新闻、音乐和社交媒体逐渐被AI接管,人工智能开发商正面临一个严峻的瓶颈。专家警告称,当AI模型反复使用由其他AI生成的数据进行训练时,会导致“模型崩溃”,最终只能输出毫无用处的同质化信息。此外,这还会放大AI的“幻觉”问题,使错误信息被当作事实基准反复强化。为了打破这种数字领域的恶性循环并顺利通过图灵测试,开发商们急需大量真实、独特且未经AI污染的人类原创内容。实体书因其包含大量尚未数字化的“原始数据”,意外成为了AI公司的资料金矿。
科技媒体404 Media近期展开了一项追踪调查。他们与一位珍稀书籍卖家合作,在一笔高达1000本书的订单中,将一枚AirTag追踪器隐藏在其中一本珍稀书籍内。经过数周的追踪,这本书从加利福尼亚州辗转密尔沃基和科罗拉多州大章克申,最终抵达了位于内华达州拉斯维加斯东北部的一个名为“LAS8”的亚马逊仓库。
据悉,该仓库通常负责按需印刷业务,但在其被称为“VGT3”的特定区域内,进行着截然相反的操作。送达这里的书籍会被直接切断书脊,书页被送入高速扫描仪转化为纯数据。这些数据既不会向公众开放,也不会被制作成供人类阅读的PDF电子书,而是专属用于喂养AI模型的算法。在榨干数据价值后,这些书籍的物理残骸将被直接丢弃。
这种对原始数据的狂热渴求,直接导致了过去一年里珍稀书籍销量的历史性激增。目前,法院已裁定这种行为在法律上是允许的,前提是企业不公开出售这些数字化的书籍副本。亚马逊并非唯一采取此种做法的企业,Anthropic等大部分大型商业AI机构也早已加入了这一行列。
业内人士警告称,由于数据终究是有限的,随着科技巨头们继续无情地榨取这些实体资源,部分极其珍稀的书籍可能会在这一过程中彻底绝迹。然而,面对日益膨胀的大模型训练需求,这些AI巨头似乎并没有停下脚步的打算。

