首页 / 科技 / AI企业批量采购二手纸质书用于训练 单笔订单规模最高100万本

AI企业批量采购二手纸质书用于训练 单笔订单规模最高100万本

摸鱼不慌
摸鱼不慌
  【CNMO科技消息】近日有调查报道显示,多家头部AI企业正通过中间商秘密采购数百万本二手书籍,扫描提取内容作为AI模型训练数据,完成数字化后将实体书销毁。AI企业批量采购二手纸质书用于训练 单笔订单规模最高100万本  第1张

今年4月以来,二手书市场出现显著变化:批量订单激增,单笔采购规模从1000本至100万本不等。这些订单的买家被证实主要为人工智能企业,它们正通过购买纸质书籍获取高质量人类原创数据,用于大模型训练。

市场数据:订单规模与价格均超常规

据书籍数据库平台ISBNdb的数据,单笔订单规模从1000本到100万本不等,采购方对价格不敏感,即使溢价也直接购买。有二手书卖家透露,此前销量好时每周约卖出20本书,近期每周销量增至数百本,是常规销量的五倍。

“采购没有特定的题材、类型或作者倾向。”——ISBNdb数据显示。

驱动因素:避免低质量AI数据污染

随着网络上低质量AI生成内容增多,污染训练数据池,AI企业开始寻找2022年之前出版的纸质印刷书籍。这类内容大多为人类原创,受AI生成内容污染的概率较低。

技术手段:破坏性扫描致实体书销毁

为提高效率、降低成本,AI企业大多选择破坏性扫描方案。该方案指拆除书籍装订后,将单页送入高速工业扫描仪逐页扫描,以快速获取数字内容,但书籍本身将因拆解而不可复原,最终导致数百万本实体书被销毁。

争议焦点:公共资源与版权问题

目前争议主要集中于两个方面。一是AI企业在扫描过程中是否会筛选稀有或绝版书籍,这类书籍退出流通可能造成公共文化资源损失。二是扫描后的书籍内容进入私有数据库用于AI训练,普通公众无法访问,相关知识不能被社会共享。

已有案例:罚款与诉讼

此前已有相关案例。AI企业Anthropic曾投入数百万美元采购纸质书籍提取信息训练Claude模型,扫描后将实体书销毁,该公司曾因存储700万本盗版书籍用于训练,被处以15亿美元罚款。近期也有出版联盟起诉Google,指控其非法使用数百万本版权书籍训练Gemini模型。

影响与展望

二手书批量采购的持续增长,反映出AI企业对高质量训练数据的迫切需求。这意味着,AI训练数据来源正从公开互联网向实体印刷品转移,传统出版业与版权管理将面临新挑战。