IT之家 8 月 17 日消息,亚马逊正大批购入纸质书籍,将内容扫描后用于训练 AI,并在扫描过程中直接销毁原书。
当地时间 17 日,外媒 404 Media 公布了一次追踪调查:调查人员把苹果 AirTag 藏进一批珍贵书籍的货件中,一路追踪这些书在美国境内的去向。
货件最终抵达亚马逊位于拉斯维加斯的一座仓库。仓库内有一支名为 VGT3 的团队,标志是一只手拿书本的霸王龙。员工称,为了提高扫描效率,他们会先切掉书脊,因此原书会在处理过程中被毁。亚马逊随后使用扫描得到的数据训练 Nova 模型。亚马逊发言人称,公司通过正常商业渠道采购书籍,用于改进产品。

一些书商怀疑,AI 公司正在尝试按照 ISBN 编号,系统性地逐本扫描出版过的书籍。纸质书的价值尤其高,因为很多内容从未出现在互联网上,而且大量书籍出版于 2022 年以前,不含 AI 生成内容。
据IT之家了解,采取这种方式的并不只有亚马逊。Anthropic 此前也曾进行类似项目。图书作者提起的一起诉讼披露了 Anthropic 内部的“巴拿马计划”:公司从电商平台购入书籍,切除书脊,再将内容数字化。
审理该案的法官裁定,这类扫描属于合理使用,不构成版权侵权。裁决的一项依据是纸质原件已经被销毁,因此不存在原书复制后再出售的情况。
亚马逊和 Anthropic 都在把部分珍贵书籍转化为企业私有的 AI 训练材料。争议在于,一些被毁掉的原书可能根本无法替代,原本能够留在公共书架上的知识也随之消失,最终只被封存在单一公司的封闭 AI 模型内部。
相关阅读: