AI公司对内存和存储资源的需求不断增加,现在开始转向人类的文学遗产。据报道,多家AI公司正通过中间商大量收购二手书,以获取高质量训练数据,同时尽量避免引起公众不满。
数据的质量比数量更重要。随着网络上越来越多低质量的AI生成内容出现,训练环境受到污染,模型变得越来越“傻”。因此,领先的AI公司转向人类创作的内容,特别是2022年之前出版的纸质书,因为那时互联网尚未被AI内容淹没,原创性更强。
使用纸质书训练模型并不是新鲜事。例如,Anthropic曾花费数百万美元购买实体书来训练其模型Claude,并在使用后销毁这些书籍。虽然法院认定“用正版书训练”属于合理使用,但Anthropic因长期持有包含700万本盗版书的数据集而被判赔偿约15亿美元。谷歌也面临类似的版权诉讼,一个出版商联盟起诉其未经授权使用数百万本受版权保护的书籍训练Gemini。
ISBNdb数据库收录了超过1.11亿本书的信息,也开始为AI企业提供大规模图书采购服务。订单规模从1000本到100万本不等。有书商透露,自今年4月以来,生意异常火爆,每周能卖出几百本书,比过去旺季时一周仅售出20本左右的情况翻了五倍。Alibris、Biblio等平台上的同行也看到了类似的大宗采购现象。
奇怪的是,采购对象几乎全是带有ISBN的书籍,包括小说、教材和专业书籍,没有明显的主题偏好。买家对价格也非常大方,即使高于市价也愿意接受。Anthropic版权案中,曾负责Google Books项目的汤姆·哈维证实,公司雇佣了多家专业扫描公司进行纸质书数字化。有些采用非破坏性扫描,有些则直接拆书送入工业扫描仪,后者更快更便宜,导致数百万本纸书被拆毁。
纸质书对AI来说确实是知识的金矿,但也引发了争议。批评者担心,扫描过程中不会区分普通书和绝版珍本,稀有书籍一旦被拆毁将永久消失。更重要的是,这些内容最终进入AI公司的私有数据库,只用于训练,公众无法访问。这意味着,人类可能会换来更聪明的AI,却可能失去那些以公开、可获取形式留给后代的知识。