中文

SUV:基于正则化选择性遗忘的可扩展大语言模型版权合规方案

计算与语言 2025-09-30 v2 人工智能 计算机与社会 机器学习

摘要

大语言模型(LLMs)通过学习从大规模数据集中获取知识,已彻底改变自然语言处理领域,但这一快速进步也引发了法律审视,因为模型无意中生成受版权保护的内容,已经引发了多起显著的诉讼。本文我们引入 SUV(Selective Unlearning for Verbatim data 的缩写),一种选择性遗忘框架,旨在防止 LLM 记住受版权保护的内容,同时保持其整体实用性。具体而言,该方法构建一个捕获目标 LLM 所犯版权侵权案例的数据集。有了该数据集,我们通过 Direct Preference Optimization(DPO)从 LLM 中遗忘内容,將受版权保护的逐字文本替换为可信且连贯的替代方案。由于 DPO 可能阻碍 LLM 在其他无关任务中的性能,我们整合梯度投影和Fisher 信息正则化以缓解性能下降。我们使用包含500部著名书籍(主要为受版权保护的作品)的大规模数据集验证了该方法,证明 SUV 在保持与无关任务性能不变的同时,显著减少了逐字记忆。对我们的数据集和公开基准的广泛实验确认了该方法的可扩展性和有效性,为缓解实际应用中 LLM 的版权风险提供了有前景的解决方案。

关键词

引用

@article{arxiv.2503.22948,
  title  = {SUV: Scalable Large Language Model Copyright Compliance with Regularized Selective Unlearning},
  author = {Tianyang Xu and Xiaoze Liu and Feijie Wu and Xiaoqian Wang and Jing Gao},
  journal= {arXiv preprint arXiv:2503.22948},
  year   = {2025}
}

备注

COLM 2025