文件在计算机中:论版权、记忆与生成式AI
计算机与社会
2025-09-03 v7
摘要
《纽约时报》对OpenAI和微软提起的版权诉讼指控OpenAI的GPT模型“记忆”了NYT的文章。其他诉讼也提出了类似主张。但各方、法院和学者对于什么是记忆、是否正在发生以及其版权影响是什么存在分歧。这些争论因“记忆”本质的模糊性而变得扑朔迷离。我们试图为这一讨论带来清晰度。我们借鉴技术文献为法律讨论提供坚实基础,给出了记忆的精确定义:当(1)可以从模型中重构出(2)某条训练数据的(3)近乎精确副本的(4)实质部分时,模型即“记忆”了该条训练数据。我们将记忆与“提取”(用户故意导致模型生成近乎精确副本)、“反刍”(无论用户意图如何,模型生成近乎精确副本)以及“重构”(通过任何手段从模型中获得近乎精确副本)区分开来。由此得出几个结论:(1)并非所有学习都是记忆。(2)记忆发生在模型训练时;反刍是症状而非原因。(3)记忆了训练数据的模型在版权意义上是该训练数据的“副本”。(4)模型不像录像机(VCR)或其他通用复制技术;它在生成某些类型的输出(可能是反刍的输出)方面比其他类型更擅长。(5)记忆不是由一心想要提取的“对抗性”用户引起的现象;它潜伏在模型本身之中。(6)模型记忆的训练数据量是训练中所做选择的后果。(7)已发生记忆的模型是否实际反刍取决于整体系统设计。在非常真实的意义上,被记忆的训练数据就在模型中——引用Zoolander的话来说,文件就在计算机里。
引用
@article{arxiv.2404.12590,
title = {The Files are in the Computer: On Copyright, Memorization, and Generative AI},
author = {A. Feder Cooper and James Grimmelmann},
journal= {arXiv preprint arXiv:2404.12590},
year = {2025}
}