热点解读

美国司法部为OpenAI合理使用抗辩背书:AI训练语料版权争议的中国镜鉴与企业合规路径

2026年9月1日,美国司法部向纽约南区联邦法院提交20页《利益声明》(Statement of Interest),首次在AI版权案中明确…

📅 2026-09-04✍️ 潘杰峰 律师👁 热点解读

2026年9月1日,美国司法部向纽约南区联邦法院提交20页《利益声明》(Statement of Interest),首次在AI版权案中明确支持OpenAI与微软的合理使用抗辩,主张训练大语言模型属于"高度转换性(spectacularly transformative)"使用,是首次联邦政府在此类案件中公开表态。同日,最高人民法院公布《人民法院知识产权司法保护实施方案(2026—2030年)》,提出"稳妥审理大模型训练语料使用及涉人工智能生成内容侵权等新类型案件"。对国内AI产品企业、版权人、内容平台而言,AI训练语料的版权争议已从"理论讨论"升级为"合规必答题":依《生成式人工智能服务管理暂行办法》第七条及《著作权法》相关规定,使用他人作品作为训练数据应当取得授权或符合合理使用等例外情形,"先训练后授权"的路径在中国法律框架下行不通。

一、美国DOJ声明的核心法律观点

1.1 事实背景

《纽约时报》于2023年12月起诉OpenAI和微软,指控其未经授权使用数百万篇文章训练ChatGPT模型,并使生成式AI产品在某些场景下能够逐字输出《纽约时报》报道内容,构成直接和间接版权侵权及商标淡化。Daily News、Chicago Tribune、Ziff Davis、Center for Investigative Reporting等多家出版商陆续加入诉讼,形成MDL(多区合并诉讼)。

2026年9月1日,美国司法部副部长Stanley E. Woodward Jr.、助理司法部长Brett Shumate、高级顾问Michael Weisbuch联名提交20页《利益声明》,明确支持OpenAI合理使用抗辩。

1.2 司法部的核心法律观点

①训练行为构成"高度转换性"使用:DOJ主张训练行为将版权文本"转换为模型用于学习语言模式和作出预测的材料",并将此种使用定性为"高度转换性",符合美国《版权法》第107条合理使用的第一个要素。

②训练与输出分离原则:DOJ明确将"训练阶段"与"输出阶段"分离,论证输出阶段对原作品市场造成的损害与训练阶段合理使用判断无关。

③国家安全与经济竞争力考量:DOJ援引2025年1月23日《消除美国人工智能领导力障碍》行政命令与2026年6月2日《促进先进人工智能创新与安全》行政命令,主张限制AI训练将"威胁国家安全,给予外国竞争对手不公平优势"。

④反垄断考量:DOJ警告,要求AI公司为训练数据付费将使"大型媒体公司获得不公平优势,限制较小的AI公司竞争能力"。

1.3 司法部声明的法律效力

DOJ声明是"非约束性陈述"。主审法官Sidney H. Stein有权决定是否采纳。学术界对此反应不一:版权律师Pamela Samuelson称其为"重大进展";多位版权学者指出,DOJ的法律推理存在明显漏洞,特别是将训练与输出分离的做法缺乏判例支持。

二、最高法2026—2030年知产保护方案:中国语境下的对应回应

2.1 方案核心条款

2026年知识产权宣传周期间,最高人民法院公布《人民法院知识产权司法保护实施方案(2026—2030年)》,其中第九条明确提出:

"妥善审理涉人工智能案件,促进有益安全公平发展。综合考量自然人输入指令的具体内容、选定和修改的具体过程等因素,判断生成内容是否体现自然人独创性的选择和表达,依法准确认定人工智能生成内容的法律属性。坚持促进发展和规范管理相统筹,稳妥审理大模型训练语料使用及涉人工智能生成内容侵权等新类型案件。"

2.2 最高法正在起草的意见

最高法明确表示,正在抓紧起草《关于依法妥善审理涉人工智能纠纷案件的意见》,努力推动人工智能朝着有益、安全、公平的方向健康有序发展。这份意见将系统回应AI数据训练、AI生成内容版权归属、AI生成内容侵权认定等前沿问题。

2.3 与美国DOJ立场的对比

与美国DOJ的"高度转换性使用"立场相比,中国最高法的表态更为审慎和平衡,强调"促进发展和规范管理相统筹"。这意味着中国不太可能简单采纳美国的"训练即合理使用"立场,更可能采取"个案审查+合理使用评估+授权义务并重"的中间路线。

三、中国法下AI训练语料的合规路径

3.1 现行法律框架

依《生成式人工智能服务管理暂行办法》第七条:"生成式人工智能服务提供者应当使用合法来源的数据……涉及他人作品的,应当取得权利人同意或符合法律法规规定的例外情形。"

依《著作权法》第二十四条:"在下列情况下使用作品,可以不经著作权人许可,不向其支付报酬,但应当指明作者姓名、作品名称,并且不得影响作品的正常使用,不得不合理地损害著作权人合法权益"——其中包括"为介绍、评论某一作品或者说明某一问题,在作品中适当引用他人已经发表的作品"等合理使用情形。

3.2 AI训练语料的合规三选项

选项一:商业授权。与版权方签订训练数据授权协议,约定授权范围、使用方式、期限、费用、违约责任等。这是中国法律框架下最稳妥的路径。

选项二:合理使用评估。对符合合理使用条件的作品,可不经授权使用。需评估:①使用目的(商业性 vs 非商业性);②作品性质(已发表 vs 未发表);③使用数量与实质性;④对作品市场和价值的影响。

选项三:开源/公有领域素材。使用开源协议明确授权训练使用的素材,或使用公有领域作品、用户明确同意的UGC内容。

3.3 关键合规动作

①建立训练数据授权链路档案。对每一类训练数据建立"数据来源-授权依据-授权范围-授权时间-授权方信息"完整档案,作为合规证据。

②开展合理使用评估。对依赖合理使用条款的数据,单独开展"四要素评估",并形成书面评估报告,保存至少5年。

③设置侵权投诉通道。建立"权利人通知-快速响应"机制,收到合格侵权通知后24小时内下架侵权训练数据或对应模型输出。

④采购商业数据。在合规成本允许的范围内,优先采购商业授权数据(如新华社图片库、视觉中国、Shutterstock等)。

四、AI训练语料版权风险的实务判断

4.1 高风险场景

①新闻报道全文训练:新闻报道通常具有较高独创性,且媒体集团(如新华社、人民日报、央视等中央级媒体集团)维权能力强,未经授权使用风险极高。

②图书全文训练:书籍的长文本训练是OpenAI、Anthropic版权诉讼的核心争议点,国内出版社、作家协会也已开始关注这一问题。

③图片/视频训练:图片、视频训练涉及视觉作品版权,目前已有视觉中国、Getty Images等向AI公司发出维权函的案例。

④音乐训练:2026年9月,Sony Music和Warner Music起诉Anthropic,指控其通过BT种子和爬虫大规模侵权获取版权音乐训练Claude模型。这一波音乐版权诉讼可能蔓延至国内。

4.2 中等风险场景

①开源代码训练:需仔细审查开源协议(MIT、Apache、GPL等),GPL等"传染性"协议可能影响模型商业化。

②学术论文训练:需注意出版社对学术论文的版权主张,以及开放获取协议的限制。

③政府公开数据:政府公报、判决书、行政处罚决定等已公开的官方数据,使用风险相对较低,但需注意个人信息和数据安全义务。

4.3 低风险场景

①公有领域作品训练:著作权保护期届满的作品,使用风险极低。

②用户明确同意UGC训练:用户协议中明确约定UGC可用于模型训练且用户明确同意的,使用风险较低。

五、独立观点:AI训练语料版权的三个判断

判断一:中国不会简单采纳"训练即合理使用"立场。中美法律体系不同、版权产业发展阶段不同、司法政策取向不同,中国更可能采取"个案审查+分类分级"的差异化路径,对新闻报道、图书长文本、图片视频等高价值作品采取更严格的授权要求,对低价值、短片段、非商业使用等场景采取更宽松的合理使用标准。

判断二:版权人或将形成"集体维权"机制。参考美国Author Guild的"集体诉讼"模式,中国版权人或将通过中国版权协会、中国互联网协会等行业组织形成集体维权机制,对AI训练数据侵权发起集团诉讼或集体投诉。

判断三:合规成本将推动数据采购市场成熟。随着合规要求趋严,AI公司对商业授权数据的需求将显著上升,可能催生"AI训练数据交易所""数据授权清算中心"等新业态。

广东华商律师事务所潘杰峰律师点评

美国DOJ为OpenAI合理使用抗辩背书是2026年最具影响力的AI版权事件,但其对中国法域的影响有限,三点判断:第一,风险提示——AI开发者最易踩的三类雷区是:未做训练数据授权链路审查、未做合理使用评估、未建立侵权投诉快速响应机制,任一项被查出都可能面临著作权侵权诉讼与监管行政处罚;第二,流程建议——训练数据合规建设应作为AI产品立项的核心要件之一,"先训练后合规"的路径在中国法律框架下行不通,建议从模型设计阶段就嵌入训练数据合规审查机制;第三,维权指引——版权人发现AI侵权时,应第一时间通过公证存证平台固定证据、向网信办投诉、向人民法院起诉同步推进,并在维权策略上考虑"先礼后兵"的和解路径,AI公司往往愿意以授权许可方式化解纠纷。

FAQ

Q1:AI训练数据是否构成"合理使用"?

中国法律没有明确给出"训练即合理使用"或"训练不构成合理使用"的统一答案,需个案审查。最高法正在起草的《关于依法妥善审理涉人工智能纠纷案件的意见》有望提供更明确的判断标准。在该意见出台前,AI公司应主动开展"四要素评估",对新闻报道、图书、图片、视频等高价值作品采取商业授权路径。

Q2:使用爬虫抓取的公开网页数据训练AI,会构成侵权吗?

存在侵权风险。"公开可访问"不等于"权利人允许使用"。权利人明确标注"禁止爬取""禁止AI训练"或网站robots.txt禁止爬取的,AI公司应遵守。依《生成式人工智能服务管理暂行办法》第七条及《著作权法》相关规定,使用爬虫抓取的公开网页数据训练AI,仍应取得权利人授权或符合合理使用条件。

Q3:被权利人投诉AI训练数据侵权,应当如何应对?

建议采取"快速响应+合规审查+分类处理"三步走策略:①收到通知后24小时内下架对应训练数据、临时冻结相关模型权重、保留完整投诉与处理日志;②开展合规审查,核查投诉涉及的训练数据来源、授权链路、合理使用可能性;③依据审查结论分类处理:合规使用的,提交抗辩材料;存在授权缺陷的,与权利人协商授权许可;涉嫌侵权的,立即下架并启动合规整改。


本文系广东华商律师事务所潘杰峰律师团队出品,仅供客户与行业参考,不构成正式法律意见。

潘杰峰 律师
广东华商律师事务所 · 深圳执业律师
AI合规与数字法律 · 复合背景 · 计算机科学 × 工商管理 × 法学
📞 咨询微信:13590105082
法律咨询:1000元/小时

有 AI 合规或数字法律问题需要专业意见?

潘杰峰律师提供 AI 产品合规设计、AI 民事争议、数据出境、
计算机类刑事辩护、知识产权(诉讼+非诉)等专业法律服务
法律咨询:1000元/小时

立即咨询 微信 13590105082

在线咨询预约

填写以下信息,潘律师会在24小时内联系您

公众号 AI合规 二维码

扫码关注公众号「AI合规」

每日 AI 法律资讯、监管动态、案例解读、
实务合规清单,与本网站内容互补更新。