大语言模型与记忆:关于版权合规质量与特异性的分析
计算与语言
2024-11-19 v3 人工智能
摘要
大型语言模型(LLMs)的记忆现象正成为日益关注的焦点。LLMs已被证明能够轻易复现其训练数据中的部分内容,包括受版权保护的作品。这一问题至关重要,因为可能违反现有版权法以及欧洲AI法案。在本工作中,我们提出了一套系统性分析方法,用于量化LLMs中潜在版权侵权的程度,以欧洲法律为例。不同于前人的研究,我们评估的是经过指令微调的模型在真实终端用户情境下的表现。我们的分析基于德国版权服务提供者法案中提出的160字符阈值,借助模糊文本匹配算法来识别潜在的版权侵权文本复现。我们分析了针对版权侵权的对策的特异性,通过比较模型在受版权保护数据与公共领域数据上的行为。我们研究了模型在不产生受保护文本时表现出的行为(如拒绝或幻觉),并对这些行为进行首次法律评估。我们发现,各大型语言模型在版权合规性、特异性以及恰当的拒绝方面存在巨大差异。Alpaca、GPT-4、GPT-3.5和Luminous在我们的比较中表现最佳,OpenGPT-X、Alpaca和Luminous产生的潜在版权侵权总数尤为低。代码可在https://github.com/felixbmuller/llms-memorization-copyright 查阅。
引用
@article{arxiv.2405.18492,
title = {LLMs and Memorization: On Quality and Specificity of Copyright Compliance},
author = {Felix B Mueller and Rebekka Görge and Anna K Bernzen and Janna C Pirk and Maximilian Poretschkin},
journal= {arXiv preprint arXiv:2405.18492},
year = {2024}
}
备注
10 pages, 3 figures, AIES 2024 conference