
2026年7月20日,美国联邦法院批准了Anthropic与部分作者、出版商等权利人达成的15亿美元集体诉讼和解。需要说明的是,这15亿美元并非法院判决的侵权赔偿,也不是AI公司使用书籍训练模型的统一许可价格。案件真正值得关注的是,法院将数据取得、资料库建设、模型训练和后续使用拆开审查:一个环节可以主张合理使用,并不意味着整条数据使用链都会自动合法。
在Anthropic案中,法院认为,将书籍用于模型训练是为了分析语言结构和统计关系,而非向用户提供原书替代品,因此相关训练具有转换性,可以构成合理使用。法院还支持了一种较窄的数字化方式:购买纸质书后扫描为数字件并销毁原件,在没有增加副本数量、没有对外传播的情况下,这类格式转换也可能受到支持。
但从盗版网站下载大量电子书并将其放入永久、一般用途的资料库,结论就不同了。法院拒绝仅仅因为这些资料未来“可能用于训练”,就把前端的盗版下载和长期保存一并视为合理使用。训练目的具有转换性,并不能自动解决数据取得方式本身的问题。Anthropic愿意支付15亿美元,更准确地说,是对集体诉讼、法定赔偿、庭审和上诉不确定性的集中定价。
对中国AI公司的三重启示
第一,数据不构成作品不等于可以随便使用。即使某些内容不受著作权保护,仍可能涉及个人信息、商业秘密、平台规则、数据库权益和合同义务。第二,公开看到或付费购买不等于可以拿来训练。购买数据库账号更像购买阅览室门票,通常允许查询和阅读,却不允许把馆藏整体搬进企业知识库。第三,不适用《生成式人工智能服务管理暂行办法》不等于没有其他合规义务。内部知识库或企业自用工具仍受著作权、个人信息、数据安全等法律约束。
合理使用并非万能
Anthropic案适用美国版权法,不能直接照搬到中国。《著作权法》第二十四条列明了合理使用的具体情形,我国目前尚未设置一项普遍适用于商业性AI训练的文本与数据挖掘例外。企业不能仅凭“训练具有创新性”“模型没有输出原文”就得出合理使用结论。最高人民法院已提出要稳妥审理大模型训练语料使用等新类型案件,国内裁判标准仍在持续形成。
对于创业公司,更现实的合规路径是:先停止新增高风险数据,再盘点历史存量;先保存来源、合同和使用记录,再决定隔离、替换还是删除。建立由业务、技术和法务共同维护的数据台账,记录每批数据的来源、授权范围、存储位置和退出机制。越早建立来源记录、授权边界和退出机制,后续整改成本越低。
声明:文章不代表CHAINTT观点及立场,不构成本平台任何投资建议。投资决策需建立在独立思考之上,本文内容仅供参考,风险 自担!转载请注明出处:https://www.chaintt.cn/63380.html