Esc
<- 所有文章

AI 版权战争,真正争夺的是谁拥有知识的未来

针对 AI 公司的版权诉讼不只是关于旧书和训练数据。它关乎未来的知识体系将由谁出资、由谁掌控。

AI 版权之争常被描述为一场围绕训练数据的法律战。这个说法没错,但格局太小了。更深层的冲突是:当知识变成基础设施时,谁该为此获得报酬。

2026 年 5 月,路透社报道,包括 Elsevier(爱思唯尔)、Cengage、Hachette、Macmillan 和 McGraw Hill 在内的出版商在曼哈顿联邦法院起诉 Meta,指控 Meta 滥用书籍和期刊文章来训练 Llama。这起诉讼只是更广泛诉讼浪潮的一部分——作者、新闻机构、视觉艺术家和其他权利持有者纷纷起诉 AI 公司。

法律问题是合理使用。经济问题则大得多。

训练数据是被隐藏的供应链

AI 模型看起来神奇,是因为界面很简单:问一个问题,得到一个答案。但在答案背后,是一条由书籍、文章、网站、代码、图像、视频和人类劳动组成的供应链。

多年来,互联网让内容变得容易被索引。生成式 AI 让内容变得容易被重新混合。这改变了原来的交易逻辑。搜索引擎会把流量导回来源。AI 助手则可能直接给出答案,减少了用户访问原出版方、作者或艺术家的需求。

如果这成为知识获取的默认界面,那么训练数据就不仅仅是一种输入,而是产品价值的一部分。

合理使用问题并不稳定

AI 公司主张,训练具有变革性,且对社会有益。权利持有者则主张,未经许可大规模使用受版权保护的作品是一种攫取,尤其是当输出与原作品市场形成竞争时。

法院必须划定这条界线。但即便判决清晰,也未必能解决更大的问题。不同的媒体类型、授权实践、模型行为和输出风险,可能导致不同的结果。

教科书、小说、新闻档案、歌曲、照片和软件代码库,并不会引发完全相同的实际问题。

出版商保卫的不只是文件

对出版商来说,担心的不只是旧作品被复制,而是:如果 AI 系统吸收了付费内容、生成替代品、并把用户留在 AI 平台内部,未来的市场可能会崩塌。

这并不意味着每一桩版权主张都同样有力。但它意味着商业模式问题真实存在。如果高质量信息成了 AI 系统的燃料,而创作者和编辑却无法为未来的工作筹集资金,知识基础就会随时间不断削弱。

AI 需要可信赖的材料。可信赖的材料需要机构、激励和人来支撑。

我的看法

最可能的长期答案,既不是全面禁止训练,也不是完全放任。而是一个混乱的授权与透明生态:一部分数据开放,一部分获得授权,一部分被排除在外,一部分通过集体机制获得补偿,还有一部分使用方式因风险和市场影响而区别对待。

公众应该关心这件事,因为结果将决定 AI 知道什么、重视谁的作品,以及下一代知识体系是否拥有健康可靠的来源供给。

AI 公司喜欢说他们在为所有人打造工具。如果这是真的,那么这些工具之下的知识经济也必须存活下去。

资料来源