版权侵权与大型语言模型
计算与语言
2023-10-24 v1 人工智能
摘要
语言模型可能记忆的不仅仅是事实,还包括训练期间看到的整段文本。版权法的合理使用豁免通常允许在未经版权所有者许可的情况下有限使用受版权保护的材料,但通常是为了从受版权保护的材料中提取信息,而非{\em 逐字}复制。本工作通过逐字记忆的视角探讨版权侵权与大型语言模型的问题,重点关注受版权保护文本的潜在再分发。我们针对一系列流行书籍和编程问题,在多种语言模型上进行了实验,对这些语言模型再分发此类材料的程度给出了保守的刻画。总体而言,本研究强调了进一步审查的必要性,以及其对自然语言处理未来发展的潜在影响,以确保遵守版权法规。代码见 \url{https://github.com/coastalcph/CopyrightLLMs}。
引用
@article{arxiv.2310.13771,
title = {Copyright Violations and Large Language Models},
author = {Antonia Karamolegkou and Jiaang Li and Li Zhou and Anders Søgaard},
journal= {arXiv preprint arXiv:2310.13771},
year = {2023}
}
备注
EMNLP 2023