SHIELD: 面向大语言模型文本生成中版权合规性的评估与防御策略
计算与语言
2024-08-22 v2 人工智能
计算机与社会
摘要
大语言模型(LLMs)已经变革了机器学习,但由于其可能生成侵犯版权的文本而引发了重大的法律问题,导致了几起备受瞩目的诉讼。法律环境正努力跟上这些快速发展的步伐,关于生成的文本是否可能抄袭受版权保护材料的争论仍在继续。当前的LLMs可能会侵犯版权,或者过度限制非受版权保护的文本,这导致了以下挑战:(i)需要一个全面的评估基准来从多个方面评估版权合规性;(ii)评估针对规避安全防护攻击的鲁棒性;以及(iii)开发针对生成受版权保护文本的有效防御。为了应对这些挑战,我们引入了一个精心策划的数据集来评估方法、测试攻击策略,并提出了轻量级、实时的防御措施,以防止生成受版权保护的文本,确保LLMs的安全合法使用。我们的实验表明,当前的LLMs频繁输出受版权保护的文本,并且越狱攻击可以显著增加受版权保护输出的数量。我们提出的防御机制通过有效拒绝恶意请求,显著减少了LLMs生成的受版权保护文本的数量。代码已在 https://github.com/xz-liu/SHIELD 公开。
引用
@article{arxiv.2406.12975,
title = {SHIELD: Evaluation and Defense Strategies for Copyright Compliance in LLM Text Generation},
author = {Xiaoze Liu and Ting Sun and Tianyang Xu and Feijie Wu and Cunxiang Wang and Xiaoqian Wang and Jing Gao},
journal= {arXiv preprint arXiv:2406.12975},
year = {2024}
}
备注
Work in progress