Anthropic 那场被戏称为“当代焚书坑儒”的诉讼,终于落下了帷幕。有意思的是,判决结果里最讽刺的一幕,恰恰是那些被视为违法的行为中,唯一合规的部分。
从 2024 年 8 月立案,到本月 20 号尘埃落定,这场拉扯了近两年的盗版书训练集体诉讼案画上了句号。法院最终拍板:Anthropic 需向原告支付 15 亿美元的天价和解金。
这笔钱有多吓人?咱们不看那些虚高的 ARR 数据,仅据路透社此前的报道,Anthropic 在 2023 年至 2025 年的两年间,实际营收也就 50 亿左右。这一刀下去,几乎切中了动脉。在出血如此巨大的 AI 公司中,Anthropic 算是第一个吃螃蟹(也是第一个挨揍)的,杀鸡儆猴的效果立竿见影。
出了这么大的乱子,我立马去翻了判决书,发现里头的水比想象中深得多。
这一切的起因,还得怪 Anthropic 自己递出的那把“刀子”。
早在 2021 年 12 月,Anthropic 发表过一篇论文,详细披露了早期大模型的训练数据来源。除了常见的 Common Crawl 网页爬取内容外,网络书籍也是重要来源。其中,引用区里一个叫 The Pile 的数据集格外引人注目。因为当时,The Pile 包含一个名为 Books3 的子集。
Books3 囊括了近 20 万本无版权电子书。可以说,几乎所有主流大模型都曾拿它做过训练。如今,Books3 早已明面下架,成了行业里心照不宣的秘密。
不过,彼时 Anthropic 还处在学术研究阶段,版权方顶多先拿小本本记上一笔。
真正将 Anthropic 推上风口浪尖的,是 2024 年媒体对企业使用 The Pile 训练模型发起的大调查。
面对记者追问,Anthropic 发言人不得不承认,商业模型 Claude 确实使用了包含侵权内容的 The Pile 进行训练。
这下彻底激怒了版权方。逻辑很简单:你非法窃取我的作品,靠训练出的模型赚钱,甚至可能抢了我的饭碗,最后却让我分文不得?
于是,三名作家代表数十万版权人,直接向 Anthropic 发起了诉讼,造就了这起史上规模最大的 AI 版权案。
案件正式立案后,原告获得了深入调查 Anthropic 内部的机会。结果令人咋舌:Books3 的那几十万本书根本不算什么,这里还有 LibGen、PiLiMi 等资源,加起来至少有七百万本非法下载的无版权书籍!
与此同时,这起案件中槽点最大、却又完全合法的操作浮出水面:花数百万美元收购纸质书,去皮切页,进行破坏性扫描以构建数据库……
2024 年,Anthropic 曾意识到利用盗版书籍训练模型的法律风险。于是,他们开始购买纸质书,扫描入库制成数据集后立即销毁原书,且该数据集仅限公司内部用于模型训练,严禁外传。
这套操作完美契合美国版权法中的“首次销售原则”:只要你买了第一次,后续如何处置由你决定,只要不产生新的副本即可。
但从更宏大的视角——比如 AI 领域常挂嘴边的“人类文明高度”来看,Anthropic 本不必做得如此绝情。Google Books 便是先例,对方扫描完整图书并保留原件,法院依然认定其为合理使用。
但为了规避法律风险(更可能是因为破坏性扫描成本最低、最便捷),Anthropic 还是选择了将书拆成一页页纸,直接塞进扫描仪。
一边高呼要控制 AI 发展速度,一边停不下来扫书毁书训模型的手,这种双面操作,Anthropic 算是玩明白了。
消息曝光后,瞬间引爆公众怒火。相关讨论帖在社交媒体上的浏览量突破两千万,骂声已累积近四千楼。
多位专家学者也站出来谴责,认为 Anthropic 此举极不地道。谁也无法保证被销毁的书里没有珍稀孤本。
一位二手书商在接受采访时透露,他的库存中包含许多罕见、绝版及外语书籍,其中部分被销毁的书籍,竟是市面上流通的最后几本。
即便不考虑某些书籍本身的艺术价值,Anthropic 将这些书数字化并录入数据库后,其内容也将被永久封存。这难道是想独占人类文明吗?
这回,“历史罪人”与“知识垄断商”的帽子,结结实实地扣在了 AI 头上。连马斯克都没忍住,出来踩了一脚。
更具黑色幽默的是,这唯一合法的操作,反而向法官证明:Anthropic 你是懂版权法的呀。既然清楚如何规避风险,那此前下载盗版书的行为,便是明知故犯,罪加一等。
坏事做尽,终遭恶报。
目前,案件已进入判决后的上诉期。在被侵权的作品中,已有 91.3% 完成申领。若判决顺利执行,每本书可获得 3000 美元的和解金。
值得注意的是,在这场天价官司中,获利最多的竟是原告的律师团。起初律师要求抽取和解金的 20%,即整整 3 亿美元。
法院觉得太过分,将其砍至 1 亿美元。即便如此,我依然觉得离谱……一场官司赚的钱,抵得上我一辈子的收入,是我入错行了吗?QAQ?
当然,即便 Anthropic 已被各方割了一刀,这大概率还不是它为版权支付的最后一笔费用。不少放弃集体诉讼的版权方,仍在单独起诉 Anthropic。
但这起判决,无疑给所有尚未落槌的 AI 版权案打了个样:无需漫长的法庭拉锯,也无对科技巨头的偏袒,法院判决果断干脆。大家先拿钱再说,拖得越久,对谁都没好处。
截至今日,Anthropic 盗版书集体诉讼案暂告一段落,但 AI 与版权的争议远未终结。
AI 究竟能否在未获授权的情况下,直接使用真人创作者的作品进行训练?
如果 AI 生成的内容复刻了真人作品的风格与表达,是否构成侵权?
一旦认定侵权,责任主体又该如何界定?
我们究竟要在 AI 发展与人类权益之间,寻找怎样的平衡点?
比起超级智能、灾难性风险、人类长期福祉这些即使签署百份协议也难以解决的宏大命题,Anthropic 不如回头看看,在这场无人愿主动退出的 AI 竞赛中,有哪些问题是可以凭良心优先解决的。
撰文:莫莫莫甜甜
编辑:江江 & 面线
美编:素描
图片、资料来源:
路透社、X、404 media、arxiv、
https://storage.courtlistener.com/recap/gov.uscourts.cand.434709/gov.uscourts.cand.434709.680.0_5.pdf
















