在应对由新闻出版商及图书作家发起的联合版权侵权诉讼中,微软公司向法庭提交了最新辩护材料,坚称其人工智能聊天机器人 Copilot 几乎从不逐字复制或实质性复现《纽约时报》等媒体的报道及受版权保护的文学作品。这一表态旨在为微软与 OpenAI 构筑坚实的“合理使用”法律防线,并推动法庭尽早通过即决判决结束相关案件的审理。
作为诉讼证据开示程序的一部分,微软向原告新闻机构所聘请的专家开放了包含 820 万条 Copilot 真实对话记录的数据库。微软指出,该数据集并非随机抽取,而是专门根据与原告新闻网站相关的关键词进行了精准筛选,理论上是“最有可能出现涉嫌侵权内容”的样本集合。
然而,数据分析结果显示出极低的重复频率。在这 820 万条筛选记录中,仅有 59545 条记录包含了至少 16 个与模型训练所用新闻内容重合的连续词汇,占比不足总记录量的 1%。此外,在涉及非营利调查报道机构“调查报道中心”(Center for Investigative Reporting)的诉讼指控中,原方专家在海量样本中也仅识别出 51 起与该机构素材构成“实质性重合”的个例。
在作家群体针对图书版权提起的另一起合并审理案件中,测试数据同样展现出类似趋势。由原告作家方聘用的独立专家针对被评估的 212 部涉案书籍进行了排查,最终仅在 10 本书中找到了至少 30 个词重合的生成记录,这类匹配样本总计仅有 24 条。
微软据此向法庭主张,这些详实的数据恰恰印证了其核心法律抗辩,即利用受版权保护的材料训练大语言模型属于美国版权法框架下的“合理使用”。微软强调,Copilot 及其背后的生成式 AI 系统对版权素材的使用目的与原始出版物有着本质区别,其根本机制是汲取并重组语言模式以生成全新内容,而非作为原版作品的替代品流通。即便偶发性地出现了零星文字片段的复现,也无法抹杀大语言模型训练过程所具备的“转换性使用”(transformative use)特质。
此前,包括《纽约时报》、调查报道中心以及美国作家协会(Authors Guild)在内的多家媒体机构和创作者群体联合发起诉讼,指控微软与 OpenAI 未经授权非法抓取数以百万计的原创文章与书籍来训练其商业化 AI 平台,并通过生成高度重合的内容与原作者直接竞争,严重冲击了独立新闻业和文学创作的商业生态。为提升司法审理效率,涉及新闻出版商与作家的相关诉讼目前已被合并交由同一名联邦法官审理。
目前,微软已正式向法院申请即决判决,希望借助上述数据证明原告的实质性侵权指控缺乏普遍事实依据,从而在早期阶段化解这场关乎生成式人工智能底层训练合法性的行业关键诉讼。截至目前,《纽约时报》、调查报道中心及美国作家协会尚未就微软提交的最新统计数据与法庭陈述公开发表评论。
