bot.gif
取消
选择语言
确认
简体中文
繁体中文
English
close
正在加载
亚马逊被曝拆解珍本图书用于AI训练
互联网 · 2026-08-18 00:48
2
摘要
404 Media称,亚马逊购买稀有图书并扫描内容,用于 AI 模型训练 。
币界网报道:

TechCrunch援引 404 Media 报道称,亚马逊正在购买大量稀有图书,拆除书脊后扫描内容,以获取可用于训练 AI 模型的文本数据。一册被放入追踪器的珍本图书,最终被送至亚马逊在拉斯维加斯的设施。

图书被追踪至 VGT3

404 Media称,这本图书最后到达名为 VGT3 的亚马逊设施。该地点使用“恐龙爪持书本”标识。亚马逊向 404 Media 表示,公司会通过商业渠道购买图书,用于改进客户使用的产品和服务。

绝版文本成新语料来源

报道指出,训练大语言模型需要极大规模的文本数据,而互联网上可直接获取的公开内容已被大量使用。对亚马逊这类公司而言,绝版、稀有或在线难以找到的图书,正成为新的训练语料来源。

模型训练转向线下资料

这类文本的价值还在于,出版时间早于 2022 年的内容通常不含 AI 生成文本。报道提到,模型如果持续摄入过多 AI 生成内容,可能出现“模型坍塌”,即输出质量逐步下降。这也让 AI 公司如何获取高质量原始文本,再次成为焦点。

相关资讯
Higgsfield完成4亿美元B轮融资
互联网 · 2026-08-18 03:09
img
Reddit测试音频视频版帖子体验
互联网 · 2026-08-18 02:49
img
YouTube调整播放量统计口径
互联网 · 2026-08-18 02:29
img