关键词: Anthropic Claude 版权和解 AI训练数据 作家集体诉讼
当地时间7月20日,美国加州北区联邦法院法官正式批准Anthropic与作家群体达成的15亿美元和解协议。这起始于2024年8月的集体诉讼,因AI公司涉嫌使用盗版书籍训练大语言模型而备受关注,最终创下美国历史上最大规模的版权赔偿纪录。

(路透社相关报道)
2024年8月,惊悚小说作家安德里亚·巴茨(Andrea Bartz)、非虚构作家查尔斯·格雷伯(Charles Graeber)和柯克·华莱士·约翰逊(Kirk Wallace Johnson)以个人名义代表其他当事方,向加州北区联邦法院提起集体诉讼,指控AI公司Anthropic在未经授权的情况下使用其作品训练Claude大语言模型。
根据法庭文件,Anthropic承认使用了开源数据集"The Pile"进行模型训练,其中包含一个名为"Books3"的子集,该子集被原告形容为"盗版书的富矿"。此外,Anthropic还从两个臭名昭著的盗版网站——Library Genesis(LibGen)和Pirate Library Mirror(PiLiMi)——下载了大量书籍。法官威廉·阿尔索普(William Alsup)在裁决书中指出,Anthropic从LibGen下载了至少500万本盗版书,从PiLiMi下载了至少200万本,总计超过700万本。
2025年6月,阿尔索普法官做出了一项关键性的混合裁决。他认定,Anthropic使用合法获取的书籍进行AI训练属于"合理使用"(fair use),因为这一使用具有"极致的变革性"(quintessentially transformative)。然而,法官同时裁定,从盗版网站下载并永久存储这些书籍以构建"中央图书馆"的行为不构成合理使用,"本质上、不可挽回地构成侵权"。这意味着,虽然AI训练本身在该法官的裁决下可能合法,但获取数据的方式若涉及盗版,则面临巨额赔偿责任。
2025年8月,阿尔索普法官将案件认证为集体诉讼,定义诉讼类别为"Anthropic从LibGen或PiLiMi下载的所有书籍的独家复制权的所有受益人或合法版权所有者"。这一认证使得最初的三名原告代表扩大到涵盖约482,460本书的版权持有者,包括作者和出版商。根据美国联邦版权法,故意侵权的法定赔偿最高可达每部作品15万美元,这意味着Anthropic面临的理论赔偿额可能超过700亿美元。
为避免案件进入庭审阶段,双方选择和解。2025年9月,阿尔索普法官初步批准和解协议;2026年7月20日,接任的法官马丁内斯-奥尔金做出最终批准,为这场持续近两年的诉讼画上句号。
根据和解协议,Anthropic将支付15亿美元进入和解基金,覆盖约48.2万至50万本符合条件的书籍,每本书的赔偿金额约为3000美元。
马丁内斯-奥尔金法官在裁决书中指出,每部作品约3000美元的赔偿"是普通侵权法定最低赔偿金额750美元的4倍",也"是故意侵权法定最低赔偿金额的4倍"。她认为,考虑到诉讼涉及的是"新颖的索赔主张",且"审判结果并不确定,败诉将使集体成员没有任何追索权",这一和解为集体成员提供了"有意义的救济"。
根据原告律师的声明,约91%的受覆盖书籍已被作者或出版商认领,"这是有史以来最大规模的版权赔偿"。作为和解条件的一部分,Anthropic还必须在最终判决后30天内销毁下载的盗版文件及其衍生副本。
美国出版商协会(AAP)主席兼首席执行官对此表示:"我们欢迎法院最终批准这项和解,这代表着在追究大型科技公司肆无忌惮地侵占属于作者和出版商的知识产权和创意财产的更大斗争中取得了一场重要胜利。"
Anthropic案并非孤例。近年来,随着生成式AI的爆发,围绕训练数据版权的诉讼浪潮席卷全球。然而,行业应对策略正从“先使用后谈判”转向“授权优先”的合规模式。
2025年曾是AI内容授权协议爆发的一年。OpenAI与新闻集团(News Corp)、Axios、The Guardian、Vox Media等达成多年授权协议;Google与Associated Press、Mistral与法新社(AFP)签署合作;Meta在2025年12月与CNN、Fox News、USA Today等7家出版商达成首批AI内容授权协议;Microsoft则推出了Publisher Content Marketplace,采用按使用付费模式。

(OpenAI宣布与新闻集团达成协议)
这些协议标志着出版业与AI产业的关系从对抗走向合作。对出版商而言,授权协议提供了新的收入来源,同时保留了对内容使用方式的控制权;对AI公司而言,获得高质量、合法授权的内容不仅降低了诉讼风险,也提升了模型输出质量。
关于AI训练数据的版权规则,全球正经历激烈的立法博弈。英国政府曾在2024年底提出“opt-out”方案,即允许AI公司默认使用受版权保护的作品进行训练,除非权利人主动选择退出。但该方案遭到出版业和作家群体的强烈反对,美国作家协会与英国作家协会联合声明指出,opt-out模式将版权保护的负担转嫁给创作者,违背了版权自动产生、无需积极行为即可享有的基本原则。2026年3月,英国政府正式宣布放弃这一“首选方案”,不再偏好任何单一模式,转向更审慎的评估。
批评者认为,一旦AI模型在作品上完成训练,知识无法被“遗忘”,即使创作者后来选择退出,模型已提取的模式和洞察依然存在,侵权已经发生且无法逆转。因此,越来越多的声音呼吁采用“opt-in”(自愿加入)模式,即仅在获得版权持有者明确授权的情况下方可使用其作品进行训练。美国作家协会公开主张,任何AI训练使用受版权保护的作品都必须获得作者的明确许可,并建议建立行业统一的授权框架和补偿机制。
Anthropic诉讼案的最终裁决为AI时代的知识产权保护提供了多重启示。
第一,区分“训练行为”与“获取行为”的合法性。 阿尔索普法官的混合裁决揭示了一个关键法律界限:使用版权作品训练AI模型本身可能构成“合理使用”,但非法下载和存储盗版作品则明确构成侵权。这意味着AI公司不能仅以“训练是合理使用”为盾牌,为其盗版数据来源免责。正如美国出版商协会帕兰特所言,“从盗版网站下载不应被简单接受为侵权者的效率选择;相反,这是令人憎恶的行为,绝不应被正常化”。
第二,创作者需采取主动防护措施。 在立法完善之前,创作者可通过多种技术手段保护作品:在网站和作品中嵌入明确的AI训练限制声明;使用robots.txt或元标签阻止AI爬虫;定期使用反向搜索工具监控作品是否被未经授权使用;加入作家协会或集体管理组织以获取集体谈判和法律支持。美国作家协会建议作者在版权页添加“No AI Training”(不得用于AI训练)等声明,从而增强法律立场。
第三,建立集体管理与行业协商机制。 面对海量作品和分散的创作者,个体维权成本极高。Anthropic和解案中设立的“作者-出版商工作组”(Author-Publisher Working Group)由作家协会CEO和美国出版商协会CEO共同领导,负责制定资金分配方案,处理作者与出版商之间的权益分配争议。这种模式为未来类似案件提供了参考:通过行业代表组织参与和解谈判,可以更公平地平衡各方利益。
第四,推动国际立法协调与标准统一。 当前各国对AI训练数据的版权规则差异显著:美国依赖“合理使用”个案判断,欧盟采用“opt-out+透明度”框架,英国、中国、印度等国也在制定各自规则。这种碎片化增加了跨国AI公司的合规成本,也使创作者面临“选择法院”(forum shopping)的困境。未来需要在国际层面(如通过WIPO或双边协议)推动更统一的训练数据版权标准,明确“文本与数据挖掘”(TDM)例外的适用范围、补偿机制和技术保护措施。
来源:电子工程专辑