热点解读

AI训练不构成合理使用:汤森路透诉Ross案给中国企业的启示

美国联邦第三巡回上诉法院9月29日在汤森路透诉Ross Intelligence案中认定:为训练AI产品复制受版权保护的Westlaw法律编…

📅 2026-10-04✍️ 潘杰峰 律师👁 热点解读

美国联邦第三巡回上诉法院9月29日在汤森路透诉Ross Intelligence案中认定:为训练AI产品复制受版权保护的Westlaw法律编者按,不构成合理使用。这是美国首个在联邦上诉层面处理AI训练合理使用的判决,核心逻辑是"商业竞争性使用+最小限度转换+损害训练数据授权市场"。该判决对美国以外没有法律拘束力,但它与《著作权法》第24条封闭式列举的中国规则相互印证:指望"AI训练=合理使用"的默认豁免,在中国同样没有法律依据,训练数据的授权与留痕才是正道。

一、法院为什么拒绝合理使用抗辩?

判决对合理使用四要素的展开极具实务价值。第一要素"使用目的与性质":Ross的产品与Westlaw同属法律检索服务、直接竞争,属于"以同样的方式使用编者按",只有最低限度的转换性——即便最终产品只向用户输出裁判文书原文、从不展示编者按,法院仍认定训练用途与原作品用途同质。第二要素"作品的性质":编者按虽附属于不受版权保护的裁判文书,但凝结了编辑对法律要点的选择、概括与措辞,具有"创造性火花",构成独立作品。第三要素"使用数量":Ross复制约2500条编者按用于训练,并非微不足道。

第四要素"市场影响"最值得注意:法院认定损害存在于两个市场——现有的法律检索市场,以及正在快速形成的"授权内容用于AI训练"的许可市场。权利人正在开发或合理预期的市场,同样属于应受保护的范围。法院还驳回了"中间复制"抗辩:Ross引用Google诉Oracle案主张训练中间过程可豁免,法院回应——那些先例建立在"复制系必要"的基础上,而Ross手中已有裁判文书,复制编者按只是为了省事,"便捷不是复制的理由"。

二、AI训练属于合理使用吗?中国法的答案更严格

不少从业者有一个默认想象:训练是"技术性中间使用",各国法律迟早会开口子。中国法的现状恰恰相反。

《著作权法》第24条采取封闭式列举,为合理使用划定了12种具体情形,外加一项兜底——"法律、行政法规规定的其他情形"。为机器学习复制作品,不在列举之中,兜底项也未被现行行政法规打开。《生成式人工智能服务管理暂行办法》第七条反而从义务端切入:使用具有合法来源的数据和基础模型,涉及他人知识产权的,应当依法承担保护责任;训练数据处理活动还须遵守《数据安全法》等规定。换言之,中国没有"训练例外",只有"授权合规"。

与美国判例相比还有一点差异值得注意:第24条没有开放式的四要素权衡,法院很难通过个案为训练创设例外。国内已出现的相关争议,也多从数据抓取手段、竞争秩序、内容标识等角度切入,而非寄望合理使用抗辩。美国第三巡回法院把"训练数据授权市场"作为独立市场加以保护,这个思路对中国法院认定损害赔偿、确定许可费参照同样具有参考价值——内容方与AI企业之间的授权交易,正在从商业实践上升为司法确认的权利市场。

三、判决的边界在哪里?不要过度解读

需要冷静看待的是,本案的技术形态并非生成式AI:Ross的工具用训练数据定位并返回既有裁判文书段落。法院明确指出,本意见不回答"用版权作品训练生成式AI是否构成合理使用"的问题,并在判决中把它与OpenAI相关诉讼作了区分。生成式场景下"学习模式而非复制表达"的转换性论证,仍有争辩空间。

对中国企业而言,判决的"边界提示"意义有三:第一,它强化了非生成式场景(检索、推荐、垂直问答)下训练数据侵权风险的可预见性;第二,它显示美国司法对"训练数据授权市场"的认可在加快,全球内容授权谈判的定价基准会随之上行——判决后美国出版商协会与作家协会第一时间声明欢迎,行业组织的立场会进一步推高授权市场的博弈筹码;第三,中国AI企业出海涉及美国市场数据时,不能再以"训练用途"为由低估授权必要性。

四、训练数据合规的操作建议

第一,绘制训练数据地图:语料的来源(自采、公开网络、第三方采购、用户上传)、权利状态、授权链条逐一登记,形成可审计的资产清单。第二,优先走授权与采购:对高价值内容库,参考国内外新兴的AI训练授权市场签订许可协议,把授权范围、用途限制、输出审查写清楚。第三,公开数据的抓取合规:遵守robots协议与平台条款,避开需要突破技术措施的数据源,防止版权纠纷升级为《反不正当竞争法》项下责任,甚至触及《刑法》第285条、第286条的数据犯罪。第四,留痕与溯源:保存语料采集时间、方式、清洗记录,一旦发生争议,溯源能力就是抗辩能力。

第五,用户上传数据别忽视。训练管线里常混入用户上传的图片、文本、语音,这部分语料的授权链条最弱、争议最多。应在用户协议中取得足够的训练使用授权,并提供便捷的退出机制;对明显属于他人版权客体的上传内容,应设置过滤与投诉响应流程,避免"平台担保式侵权"。第六,关注输出端:模型输出与训练内容实质性相似,是侵权认定的重要入口,应建立输出查重与相似度监测机制,把风险拦截在发布之前。


广东华商律师事务所潘杰峰律师点评

广东华商律师事务所潘杰峰律师提醒:这份美国判决不能直接引用到中国诉讼,但它与《著作权法》第24条的封闭式合理使用制度指向同一个结论——训练数据的默认豁免并不存在。实践中最容易被低估的是两点:一是"训练数据授权市场"正在成为法院认定损失和许可费的参照系,拖延授权谈判的成本会越来越高;二是抓取手段合规与版权合规是两条线,即便内容可自由使用,突破技术措施抓取也可能单独构成不正当竞争或数据犯罪。建议内容企业尽快盘点自有内容的训练授权空间,AI企业则把数据溯源档案当作与模型权重同等重要的资产来管理。

FAQ

Q1:用公开网络上能免费浏览的内容训练AI,在中国违法吗?

A:能否免费浏览不等于可以自由用于训练。《著作权法》第24条的合理使用情形不包括机器学习,大规模复制作品用于训练原则上需要授权。实践中风险程度取决于内容类型、使用规模、是否替代原作品市场等因素;涉及他人权利客体的,应尽量取得授权或使用合规来源,并做好来源留痕。

Q2:美国判决会直接影响中国AI企业吗?

A:判决对中国法院没有拘束力,直接影响限于在美国市场运营、使用美国数据源或与美国主体交易的场景。但存在间接影响:全球内容授权市场的定价与条款会参照此类判例调整;中国法院在认定损害赔偿、评价训练行为正当性时,也可能参考其"授权市场"的分析框架。

Q3:生成式AI训练被认定侵权的风险有多大?

A:本案法院明确未处理生成式AI场景,全球范围内生成式训练的合理使用问题仍未定论。中国司法已有AI生成物著作权、AI声音侵权等判例,训练数据侧的争议多通过不正当竞争、数据抓取路径解决。稳妥策略是按"授权合规"设计训练管线,不把希望寄托在任何"训练例外"上,同时跟踪人工智能立法及配套规则对训练数据的制度安排。

潘杰峰 律师
广东华商律师事务所 · 深圳执业律师
AI合规与数字法律 · 复合背景 · 计算机科学 × 工商管理 × 法学
📞 咨询微信:13590105082
法律咨询:1000元/小时

有 AI 合规或数字法律问题需要专业意见?

潘杰峰律师提供 AI 产品合规设计、AI 民事争议、数据出境、
计算机类刑事辩护、知识产权(诉讼+非诉)等专业法律服务
法律咨询:1000元/小时

立即咨询 微信 13590105082

在线咨询预约

填写以下信息,潘律师会在24小时内联系您

公众号 AI合规 二维码

扫码关注公众号「AI合规」

每日 AI 法律资讯、监管动态、案例解读、
实务合规清单,与本网站内容互补更新。