首页 / 科技 / Anthropic盗版书训练集体诉讼案以15亿美元和解告终

Anthropic盗版书训练集体诉讼案以15亿美元和解告终

摸鱼不慌
摸鱼不慌

自2024年8月起诉的Anthropic盗版书训练集体诉讼案,于本月20日获得法院批准的和解协议。根据协议,Anthropic将向原告支付总计15亿美元和解金。

案件时间线

该集体诉讼于2024年8月正式提起,指控Anthropic在AI模型训练中未经授权使用盗版书籍。经过近两年的审理,双方于本月20日达成和解方案。

和解金额与性质

法院批准的和解金额为15亿美元。这笔费用将用于补偿被侵权的作者和出版商。和解金通常涵盖过去损失的赔偿以及未来使用的授权费用。

主体背景

Anthropic是一家人工智能企业,其AI模型训练需要大量文本数据。该诉讼的核心争议在于训练数据的版权合法性。

争议核心

原告指控称,Anthropic在训练模型时使用了未经授权的书籍,这些书籍属于盗版内容。这种行为涉嫌侵犯作者和出版商的版权。

法院角色

和解协议须经法院批准方能生效。法院在审核中重点考量方案是否公平合理,对全体原告是否有利。最终法院批准了该和解方案。

名词解读

  • 集体诉讼:由一名或多名原告代表具有相同诉求的群体提起的诉讼,判决结果适用于全体成员。
  • 和解:诉讼双方经协商自行达成的解决方案,无需等待法院最终判决。本案和解经法院批准后正式生效。
Anthropic盗版书训练集体诉讼案以15亿美元和解告终  第1张

Anthropic商业模型Claude使用含近20万本侵权电子书的数据集训练

2024年,媒体对企业使用数据集训练模型展开专项调查,将Anthropic推至版权争议中心。该公司发言人承认,其商业模型Claude在训练中使用了名为The Pile的数据集,该数据集下的Books3子集收录了近20万本未经授权电子书。

数据集背景:Books3的由来与现状

The Pile是为大语言模型训练构建的文本数据集,其子集Books3直接收集了约20万本电子书,且并未取得版权授权。明面上Books3已被下架,但在业界,它曾是几乎所有大模型共用的训练材料。

“Books3包含近20万本没有版权的电子书,可以说几乎所有大模型都用它做过训练”,但如今它已成为不能说的秘密。

从学术研究到商业侵权导火索

Anthropic早期将该数据集用于学术研究时,版权方并未立即采取行动。2024年媒体的深入调查成为关键转折,面对追问,Anthropic发言人被迫证实其商业产品Claude确实基于包含侵权内容的The Pile训练。

版权方的立场与产业影响

版权持有者对这一公开承认反应激烈,认为其作品被非法用于商业盈利,且数据提供者未获任何回报。该事件凸显了AI训练数据合规问题,尤其当数据集已从明面消失,其早期使用痕迹却仍影响当前商业化模型。

  • The Pile曾公开提供,Books3后来被下架,但许多企业已在其基础上训练模型。
  • 从科研向商业的转换使得版权追责成为可能,Anthropic的案例为同类企业设立前车之鉴。
Anthropic盗版书训练集体诉讼案以15亿美元和解告终  第2张

史上最大AI版权案立案:三名作家代表起诉Anthropic 调查发现超700万本盗版书籍被用于训练

在近期正式立案的一起版权诉讼中,三名作家代表数十万版权人向人工智能公司Anthropic提起诉讼。原告在获得内部调查机会后,发现该公司在模型训练中使用了Books3、LibGen、PiLiMi等数据集,合计包含至少700万本未经授权的盗版书籍。

调查揭露大规模非法数据集使用

原告指出,此前外界已知的Books3数据集含有数十万本图书,但内部调查进一步发现,Anthropic还使用了LibGen和PiLiMi等资源。这三类数据集累计提供超过700万本书籍,均为未获版权人授权非法下载而来。

争议性合法操作:破坏性扫描纸质书

调查还牵出一项在本案中颇具争议却唯一合规的数据获取路径:Anthropic曾花费数百万美元购入纸质书籍,通过对书籍去皮切页进行破坏性扫描,以构建专有训练数据库。

Books3、LibGen、PiLiMi均为未经版权授权的书籍数据集,被多家AI公司用于训练大语言模型。

这些纸质书籍被扫描入库制成数据集后立即销毁。该套数据集仅限公司内部用于模型训练,严禁外传。尽管这一操作在法律上合规,但其成本高昂且难以规模化复制。

公司此前已着手合规转型

根据调查披露的信息,Anthropic在2024年已意识到使用盗版书籍训练模型存在的侵权风险,并因此转向购买纸质书籍。以破坏性扫描并销毁原书的方式构建合规数据集,成为当时公司应对版权质疑的措施之一。

业内人士分析指出,围绕该案的审理可能直接影响AI行业的数据获取规范,尤其是在版权授权与训练数据来源的合规标准上,或引发行业性调整。

Anthropic盗版书训练集体诉讼案以15亿美元和解告终  第3张

A/图书破坏性扫描引争议 相关讨论浏览量两千多万

这个操作完美符合美国的版权法的 “ 首次销售原则 ”,只要你买了第一次,之后随便怎么处置都行,只要不多出来新副本。

但其实,上升到 A/ 最喜欢讲的人类文明高度,它本来有理由不要做得这么绝。

更何况 Google Books 有先例,人家就扫描了完整图书,纸书原件也没有销毁,法院依然认为是合理使用。

但 A/ 为了规避法律风险( 更可能是因为破坏性扫描成本最低最方便 ),还是把书砍成一摞摞纸页,直接塞进了扫描机。

这事儿一经披露,立刻引燃了群众的怒火。现在,讨论的帖子在社交媒体上已经有了两千多万的浏览量,骂都骂了快四千楼。

Anthropic盗版书训练集体诉讼案以15亿美元和解告终  第4张

Anthropic销毁书籍遭多方谴责 二手书商指部分为绝版孤本

Anthropic因销毁大量书籍用于数据库扫描,引发专家学者、二手书商及埃隆·马斯克的公开批评。批评者指出,此举可能毁掉珍稀孤本,且涉嫌将人类知识据为己有。

专家学者带头谴责知识垄断

多位专家学者公开批评Anthropic的行为,认为其销毁书籍的方式“不地道”。批评者指出,谁也说不准被毁的书中有无珍稀孤本,这些书籍一旦消失,其内容将被永久封存在数据库中,外界无法获取。

“你是要独占人类文明吗?”

Anthropic因此被扣上“历史罪人”和“知识垄断商”的帽子。

二手书商:被毁书籍多为流通绝版

二手书商在接受采访时表示,其库存中有大量不常见的、绝版的、外语书籍。一些被销毁的书籍是目前流通的最后几本,具有不可替代性。部分书籍本身即为艺术品,销毁行为令从业者痛心。

珍稀孤本指存世数量极少、版本独特或具有文物价值的书籍,其损毁往往意味着该版本彻底失传。

马斯克加入批评行列

特斯拉CEO埃隆·马斯克也忍不住公开批评Anthropic的做法,但未提供更多细节。

  • 批评焦点集中在知识独占与文物破坏
  • 被毁书籍包括绝版外语书籍及艺术品级别藏书
  • 目前Anthropic尚未就此事件作出回应
Anthropic盗版书训练集体诉讼案以15亿美元和解告终  第5张

Anthropic被评“懂版权法”:先前行或加重责任

一段公开评论指出,Anthropic在版权相关操作中的一个合法步骤,反而向法官证明了该公司对版权法的熟悉,并可能导致其之前下载盗版书的行为被认定为明知故犯。

操作反证

评论称:“这唯一合法的操作,恰恰向法官证明了,Anthropic 你小子是懂版权法的呀。”这表明公司有意展示的合规策略,却成为其具备法律认知的证据。

规避风险认知

同一评论强调,Anthropic清楚地知道如何规避版权风险,但未在相关活动中采用。

下载与使用盗版书

关于“之前下载盗版书使用的行为”,评论直接定性为明知故犯、罪上加罪。版权法保护作品权利,未经授权复制即构成侵权,了解法律仍实施则主观过错更明显。

坏事做太多,A/ 也是恶人有恶报了。

该评论最后以“恶有恶报”总结,虽然仅代表单方观点,但反映了对Anthropic版权合规问题的部分舆论。

Anthropic盗版书训练集体诉讼案以15亿美元和解告终  第6张

侵权诉讼案进入上诉期:91.3%作品已申领,律师费从3亿美元降至1亿美元

目前,一起侵权诉讼案进入最终判决后的上诉期。案件信息显示,被侵权的作品中已有91.3%被权利人申领。若判决成功执行,每本作品可获得3000美元和解金。同时,原告律师费用从最初要求的3亿美元被法院下调至1亿美元,引发外界关注。

作品申领比例超九成

申领是指权利人在案件指定期间内向管理机构申请登记以获取潜在赔偿的权利。目前本案申领比例已达91.3%,表明多数权利人积极参与索赔程序。按每本作品3000美元标准计算,若全部申领作品均获赔付,权利人将获得相应赔偿。

律师费调整:原比例20%降至约6.7%

原告律师最初要求收取和解金总额的20%作为费用,按此比例需3亿美元,由此推算和解金总额约为15亿美元。法院认为该比例过高,最终将律师费削减至1亿美元。调整后,律师费占和解金比例降至约6.7%,较原计划减少约2亿美元。

原律师费:和解金的20%(3亿美元)→ 调整后:1亿美元(约6.7%)

上诉期间判决尚未生效

案件目前处于最终判决后的上诉阶段,判决尚未最终生效。后续法律程序可能影响和解金的执行与分配。权利人、原告律师及社会各方持续关注案件进展。

  • 被侵权作品申领比例:91.3%
  • 单件作品和解金:3000美元
  • 原告律师最初要价:3亿美元(和解金的20%)
  • 法院调整后律师费:1亿美元
Anthropic盗版书训练集体诉讼案以15亿美元和解告终  第7张

Anthropic盗版书集体诉讼案告一段落 法院判决为AI版权案提供参照

截至今日,Anthropic涉及的盗版书集体诉讼案已阶段性结束。法院的判决被认为为后续未决AI版权案件的处理提供了参考样本。

诉讼进展与遗留争端

尽管此案告一段落,Anthropic可能仍需为版权问题支付更多费用。部分放弃集体诉讼的版权方仍分别与该公司对簿公堂。法院在此案中并未因科技巨头身份而有所偏颇,而是快速作出裁决,避免了长期的法律拉锯。

业界观察人士指出,“先拿下赔偿再说,拖延对谁都没好处。”这一模式或促使更多版权纠纷采取高效司法途径解决。

集体诉讼是指多名原告基于同一事由共同向法院提起的诉讼,能够合并处理多个类似诉求。本案中部分版权方选择退出集体诉讼,转而单独起诉,反映出权利人对赔偿方式的不同考量。

AI版权争议三大核心待解

AI与版权之间的根本矛盾并未因本案结束而消失。围绕数据使用、输出内容及责任归属,以下关键问题仍在等待法律明确:

  • AI能否不经许可直接使用真人创作者的作品作为训练素材?
  • 若AI生成内容复刻了真人作品的风格与表达,是否构成侵权?
  • 一旦认定侵权,责任应由AI开发者、使用者还是其他主体承担?

优先解决现实问题

在技术竞赛无人主动退出的背景下,如何在推动AI发展的同时保护人类创作者权益,成为必须直面的课题。比起超级智能、灾难性风险等宏大命题,这些触及底线的版权议题更值得优先处理。