新留园 海外华人的新闻与社区
论坛 新闻时事 撕开书脊、批量扫描:亚马逊被曝在内华达州仓库“毁坏”实体书以训练AI

撕开书脊、批量扫描:亚马逊被曝在内华达州仓库“毁坏”实体书以训练AI

小新 正二品 (尚书) 楼主
2026-08-28 12:25
第1楼

【核心提要】

  • 404 Media 调查揭露亚马逊位于拉斯维格斯的 VGT3 仓库正大规模拆解并扫描各类书籍。
  • 该仓库采用机械手段切开书脊,并在扫描完成后处理掉(毁损)相关纸张以构建 AI 语料库。
  • 员工透露,公司最初以“建立 Kindle 电子书库”为由掩盖真实目的,实则是为了获取大规模训练数据。

【正文报道】

近日,媒体机构 404 Media 发布的一项调查揭露了亚马逊(Amazon)在内华达州拉斯维加斯的一个秘密仓库——代号为 VGT3 的设施中,正在进行大规模的图书拆解与数字化处理。该仓库的标志是一个手持书籍、张嘴的恐龙形象。根据调查,该机构的主要职能是拆开书脊并扫描每一页内容,旨在为人工智能(AI)模型构建庞大的语料库。

据在 VGT3 工作的匿名员工透露,该仓库接收的图书种类极其丰富,涵盖了新书、二手书以及多种语言版本(包括德语、俄语和日语)。甚至有工作人员表示,他们还看到过一些具有特殊性质的文件,例如代表英国女王提交给议会的官方文件。在处理过程中,系统会通过条形码识别并剔除重复书籍,并将多余的图书退回给相关分销商。

在具体的生产流程中,员工使用一种人工操作的机器强行切开书脊,随后利用数十台扫描仪对每一页内容进行高速扫描。值得注意的是,一旦页面被扫描完成,这些纸质页面就会被处理掉(即毁损)。这种“破坏式”的处理方式确保了数据能够快速转化为数字信号,而不再保留原始的物理载体。

调查中最具争议的一点在于亚马逊对员工的沟通策略。该匿名员工透露,公司最初告诉他们,扫描书籍是为了建立 Kindle 电子书库。然而,由于此类做法涉及严重的版权法律风险,官方给出的理由被认为只是一个“借口”。随着技术的推进,这些数据最终被用于训练大型语言模型(LLM)。

此事件引发了关于科技巨头利用规模优势获取廉价、海量数据以推动 AI 竞赛的广泛讨论。通过这种物理拆解的方式,亚马逊不仅在获取内容,更是在绕过复杂的版权审查流程,直接将人类文明积累的纸质知识转化为机器可理解的数据。

背景链接:

【小编观点】
此事件再次将“AI 训练数据来源”这一核心争议推向风口浪尖。亚马逊采取这种“物理拆解”的方式,本质上是利用其庞大的物流基础设施构建一道技术与法律的灰色地带:通过大规模工业化处理,将复杂的版权问题转化为简单的生产线流程。这不仅是技术的博弈,更是科技巨头在获取数据霸权上的策略选择。

0 条回复

暂无回复,快来抢沙发吧!

  • 1 / 1 页
敬请注意:文中内容观点和各种评论不代表本网立场!若有违规侵权,请联系我们