大语言模型是否懂得尊重版权声明?
计算与语言
2024-11-05 v1
摘要
先前的研究表明,大语言模型有时会生成违反版权的内容。本文研究了另一个重要且尚未充分探索的问题,即大语言模型是否会尊重用户输入中的版权信息并作出相应的行为。该研究问题至关重要,因为若答案为否,则意味着大语言模型将成为版权侵权行为的主要促进者和加速器。我们使用多样化的语言模型、用户提示和版权材料(包括书籍、新闻文章、API 文档和电影剧本)进行一系列实验。本研究对语言模型在处理包含受保护材料的用户输入时可能侵犯版权的程度进行了保守的评估。该研究强调了进一步调查的必要性,以及确保大语言模型在处理用户输入时遵守版权法规的重要性,以防止未经授权的使用或复制受保护内容。我们还发布了一个基准数据集,作为评估大语言模型侵权行为的测试平台,并呼吁在未来进行对齐工作。
引用
@article{arxiv.2411.01136,
title = {Do LLMs Know to Respect Copyright Notice?},
author = {Jialiang Xu and Shenglan Li and Zhaozhuo Xu and Denghui Zhang},
journal= {arXiv preprint arXiv:2411.01136},
year = {2024}
}
备注
EMNLP 2024 main