中文

九种违反版权法的方式及为何我们的 LLM 不会:合理使用对齐生成框架

计算与语言 2025-06-02 v1 人工智能

摘要

大型语言模型(LLM)通常因逐字复制或缺乏充分转换性修改而重现受保护内容,面临版权侵权风险,引发了重大的伦理、法律和实际问题。当前的推理时防护措施主要依赖基于限制性拒绝的过滤器,这往往损害了模型的实用性。为解决此问题,我们与知识产权专家密切合作,开发了 FUA-LLM(Fair Use Aligned Language Models,合理使用对齐语言模型),这是一个明确旨在使 LLM 输出与合理使用原则对齐的、具有法律基础的框架。我们方法的核心是 FairUseDB,这是一个精心构建的数据集,包含 18,000 个经专家验证的示例,涵盖九种现实的侵权场景。利用该数据集,我们应用直接偏好优化(DPO)来微调开源 LLM,鼓励它们产生合法合规且实用的替代方案,而不是采取生硬的拒绝。认识到传统评估指标的不足,我们提出了新的度量标准:加权惩罚效用和合规感知调和平均值(CAH),以平衡侵权风险与响应效用。大量的定量实验和专家评估证实,与 SOTA 方法相比,FUA-LLM 显著减少了有问题的输出(高达 20\%),同时保持了现实世界的可用性。

关键词

引用

@article{arxiv.2505.23788,
  title  = {Nine Ways to Break Copyright Law and Why Our LLM Won't: A Fair Use Aligned Generation Framework},
  author = {Aakash Sen Sharma and Debdeep Sanyal and Priyansh Srivastava and Sundar Atreya H. and Shirish Karande and Mohan Kankanhalli and Murari Mandal},
  journal= {arXiv preprint arXiv:2505.23788},
  year   = {2025}
}

备注

30 Pages