TechCrunch援引 404 Media 报道称,亚马逊正在购买大量稀有图书,拆除书脊后扫描内容,以获取可用于训练 AI 模型的文本数据。一册被放入追踪器的珍本图书,最终被送至亚马逊在拉斯维加斯的设施。
图书被追踪至 VGT3
404 Media称,这本图书最后到达名为 VGT3 的亚马逊设施。该地点使用“恐龙爪持书本”标识。亚马逊向 404 Media 表示,公司会通过商业渠道购买图书,用于改进客户使用的产品和服务。
绝版文本成新语料来源
报道指出,训练大语言模型需要极大规模的文本数据,而互联网上可直接获取的公开内容已被大量使用。对亚马逊这类公司而言,绝版、稀有或在线难以找到的图书,正成为新的训练语料来源。
模型训练转向线下资料
这类文本的价值还在于,出版时间早于 2022 年的内容通常不含 AI 生成文本。报道提到,模型如果持续摄入过多 AI 生成内容,可能出现“模型坍塌”,即输出质量逐步下降。这也让 AI 公司如何获取高质量原始文本,再次成为焦点。