生成式AI训练与版权法
计算机与社会
2026-03-18 v2 人工智能
机器学习
摘要
训练生成式AI模型需要大量数据。一种常见做法是通过网络爬虫收集此类数据。然而,所收集的许多内容受版权保护。其使用可能构成版权侵权。在美国,AI开发者依赖"合理使用"(fair use),在欧洲,主流观点认为"文本和数据挖掘"(TDM)的例外条款适用。在最近的一项跨学科tandem研究中,我们详细论证了实际情况并非如此,因为生成式AI训练与TDM存在根本区别。在本文中,我们分享了主要发现及其对公共和企业研究在生成模型方面的启示。我们进一步讨论了训练数据记忆化现象如何独立于"合理使用"和TDM例外条款引发版权问题。最后,我们概述了ISMIR如何为关于生成式AI公平实践的持续讨论做出贡献,以满足所有利益相关者的需求。
引用
@article{arxiv.2502.15858,
title = {Generative AI Training and Copyright Law},
author = {Sebastian Stober and Tim W. Dornis},
journal= {arXiv preprint arXiv:2502.15858},
year = {2026}
}
备注
submitted as an overview article to the Transactions of the International Society for Music Information Retrieval