版权能否归结为隐私?
机器学习
2024-03-26 v2 密码学与安全
摘要
人们日益担忧生成式AI模型会生成与其训练所用版权材料高度相似的输出。随着生成模型的质量与复杂度大幅提升,且包含版权材料的海量数据集愈发可得,此种忧虑愈发加剧。研究者正积极探寻降低生成侵权样本风险的策略,近期一系列工作建议采用差分隐私及其他形式的算法稳定性技术,以对不存在侵权复制提供保证。本文中,我们考察此类算法稳定性技术是否适于确保生成式模型的负责任使用而不致无意违反版权法。我们认为,尽管这些技术旨在验证数据集中可识别信息的存在(因而以隐私为导向),版权法则旨在促进原创作品的使用以造福社会整体,前提是不存在对受保护表达未经授权的使用。隐私与版权之间的这些根本差异不可被忽视。特别地,我们证明,尽管算法稳定性可被视为检测复制的实用工具,此类复制并不必然构成版权侵权。因此,若将其采纳为检测并确立版权侵权的标准,算法稳定性可能会损害版权法的预期目标。
引用
@article{arxiv.2305.14822,
title = {Can Copyright be Reduced to Privacy?},
author = {Niva Elkin-Koren and Uri Hacohen and Roi Livni and Shay Moran},
journal= {arXiv preprint arXiv:2305.14822},
year = {2024}
}