据404 Media调查,亚马逊正在大量购买稀有、绝版或难以在网上找到的书籍,随后切掉书脊、逐页扫描,将其中文字数字化,用于改进AI相关产品和服务。
404 Media为了追踪这些书最终去了哪里,甚至在一本稀有书籍中放入定位设备。结果显示,这本书最后被运到亚马逊位于拉斯维加斯的一处设施VGT3。这个设施的标志是一只爪子里拿着书的恐龙。
亚马逊向404 Media确认,公司确实“通过商业渠道购买书籍,以改进客户使用的产品和服务”,但没有进一步说明这些书具体被用于哪些AI模型。
背后的原因,是AI公司越来越缺高质量的人类文本。
过去几年,大语言模型已经从公开互联网吸收了海量网页、论坛、论文和数字书籍。随着容易获得的数据逐渐被“吃完”,那些从未数字化、已经绝版,甚至只能在二手市场找到的实体书,开始变成新的训练数据来源。
尤其是老书。
2022年ChatGPT发布之前出版的书,几乎可以确定全部由人类创作。对于AI公司来说,这类文本正在变得越来越珍贵。
原因是,现在的互联网里已经混入大量AI生成内容。如果下一代模型继续大量使用AI写出的文字训练自己,就可能出现所谓的“模型坍塌”:模型反复学习自己生成的内容,错误和模式不断被放大,最终输出质量下降。
因此,未经AI污染的老文本,正在变成一种新的稀缺资源。
然而,如果亚马逊买的是普通旧书,切掉书脊扫描,市场上还有大量副本,那更多是文化保存和浪费问题;但如果买的是绝版书、稀有版本、只剩少量流通副本的资料,情况就不同了。
每毁掉一本,公共市场上可获得的副本就少一本,而亚马逊却把内容完整数字化,留在自己的私有数据集里。
原本所有人都有机会买到、借到、研究的实体知识,被一家AI公司买走、销毁,然后变成只有它的模型能够读取的私有训练资产。
如果几家大公司开始系统性扫货,这个问题就会更明显。比如某一本绝版技术书全球只剩100本,Amazon买走20本、Google买走20本、Meta再买20本,而且全部拆掉扫描。物理世界里剩下的副本越来越少,但这些公司的私有语料库却越来越完整,最后形成一种新的壁垒。#亚马逊 #ai