数百万本实体书正被切开书脊、高速扫描、统一销毁。这一离奇行为却是美国部分AI公司的日常操作。 从Anthropic代号“Project Panama”的毁书扫描计划,到图书数据库公司ISBNdb公开兜售“保证不含AI内容”的旧书,再到一批稀有书被苹果蓝牙智能追踪器AirTag追踪至亚马逊拉斯维加斯仓库,一条围绕实体书的隐秘产业链正在浮出水面。 驱动这一切的,是AI行业对“干净数据”近乎饥渴的需求:当互联网被机器生成的内容大面积污染,旧书成了最可靠的“人类知识矿藏”。而当买书、扫描、销毁被法院裁定为合理使用,这场数据争夺战在合规外衣下,也把文化遗产保护的争议推到了台前。 毁书产业链浮出水面 早在今年1月27日,《华盛顿邮报》依据悬疑小说作家安德里亚·巴茨等人诉Anthropic一案中,所解封的4000多页法庭文件披露,这家AI公司于2024年初启动代号“Project Panama”的行动,斥资数千万美元批量购入数百万本二手书,经切脊、高速扫描后销毁原书,用于训练Claude。 一份内部文件写道:“Project Panama是我们对世界上所有图书进行破坏性扫描的努力。”另一份则提醒:“我们不希望外界知道我们在做这件事。”文件显示,Anthropic曾向供应商寻求在6个月内处理50万至200万本的能力。执行负责人是2024年2月受聘的前Google Books合作负责人汤姆·特韦,采购渠道包括书籍在线销售网站Better World Books和英国最大的二手书销售商World of Books。 到今年夏天,这门生意开始走向台前。 7月21日,专注科技领域调查性报道的美国新闻网站“404 Media”记者报道,数据库公司ISBNdb在其官网公开向AI公司兜售批量实体书采购服务,单笔1000册至100万册,主打2022年前出版的书,因为这些书“结构性保证不含AI生成文本”“对现代投毒工具天然免疫”,并提供严格保密协议。报道刊发后页面被撤下,ISBNdb已放弃该业务,并称该服务从未实际成交。 另一起事件出现在欧洲。英国“City AM”网站7月29日报道,伦敦一家珍本书商收到两笔来自匿名邮箱的异常大额专业书籍询价,买家拒绝透露身份和用途。欧洲大陆的古董书商还报告了数千册冷门书的匿名订单。报道将这场抢购称为“反乌托邦式”的搜寻。 匿名买家很快露出踪迹。8月17日,“404 Media”刊出追踪调查表明,货物最终被送入亚马逊拉斯维加斯LAS8仓库代号VGT3的区域,而该区域的徽标是一只抓着书的霸王龙。亚马逊员工在内部论坛证实,VGT3的工作就是切书脊、高速扫描并销毁实体书。亚马逊确认其通过商业渠道购书以开发和改进产品与服务,但未明确这批书的具体用途。 模型崩溃阴影下的选择 AI公司为何对旧书如此饥渴?2024年7月24日,《自然》杂志在线发表论文认为,模型反复在上一代模型生成的数据上训练,会发生模型崩溃。一开始,那些不常见、属于少数派的内容会先消失;到最后,模型输出的东西会越来越单一,只剩单调的模式。保留一定比例的真实人类数据可以缓解“崩溃”,不过,真实人类数据正变得越来越稀缺。 提供搜索引擎优化的新加坡软件公司Ahrefs,在2025年4月分析90万个新建英文网页时,发现74.2%含AI生成内容,其中绝大部分为人机混合,纯AI生成占2.5%;AI代码审查公司Graphite研究则显示,2024年11月AI生成文章数量首次超过人类撰写的文章,此后占比稳定在五成左右。 人们立刻注意到,在2022年ChatGPT发布之前出版的图书,天然不含AI文本——这正是ISBNdb所谓“保证”的含义。 这些书籍的价值还不止于“干净”。Anthropic一位联合创始人曾表示,公司内部认为书籍能教模型“如何写好”,而非低质量的网络腔。ISBNdb的兜售话术更直白:“世界上最好的AI训练数据就在书架上……书籍代表经过策展、同行评审、特定领域的人类知识。” 在美国现行版权法框架下,这套操作甚至被法院认为合法:买下实体书意味着合法取得,扫描后销毁是一对一替换,不产生额外数字副本,美国法律下近乎无懈可击。但这只是版权意义上的合规,无法回答另一个问题:大量实体书被永久销毁,是否意味着人类公共知识财富的不可逆流失? 合法使用与文化代价之争 美国法律基本倾向AI公司一侧。上文提到的“巴茨诉Anthropic案”中,美国加州北区联邦法院法官于2025年6月裁定AI公司扫描毁书不违法,但从提供免费电子书的LibGen网站及其他盗版渠道下载700余万册图书,不构成合理使用。 2025年9月,Anthropic就盗版部分达成至少15亿美元和解,每部作品约3000美元。该和解于2026年7月20日获法院最终批准,最终确定的作品清单约48.2万部。这一裁决也等于为“Project Panama”式操作颁发了通行证。 非议随之从版权溢出到文化领域。被销毁的书里有没有存世稀少的珍本?目前虽未被核实,但有书商担忧,一些流传极少的书籍可能在匿名大宗采购中悄然消失。问题的核心在于:毁书是不可逆的,对文献学而言,毁掉的就是实物。而在法律层面,AI公司依然可以声称其合法购得的文献,处置权也属于买家。文化保护的诉求与财产权的行使只能继续碰撞。 正是在这样的真空地带,争议持续发酵。美国国会没有专门针对AI训练数据版权的统一立法,靠判例逐案划定边界,“合法购得即可销毁”的裁决客观上为毁书打开了方便之门,也为日后的声讨与诉讼埋下伏笔。 与之相对,我国早在2023年8月15日就施行《生成式人工智能服务管理暂行办法》,第七条明确要求训练数据来源合法、不得侵害知识产权,并要求增强数据的真实性、准确性、客观性、多样性。 把规则立在产业狂奔之前,让规范引导技术发展与权益保护并行。当数百万本旧书在大洋彼岸被切碎之时,制度先行的价值正愈发清晰。(记者 张梦然)
【责任编辑:朱家齐】
来源:科技日报