中文

Obliviate:用于保护大型语言模型知识产权的高效忘忘技术

计算与语言 2025-06-13 v2 人工智能 密码学与安全 机器学习

摘要

近期 AI 公司与内容创作者之间的版权协议凸显了对语言模型能够复现受版权保护文本的细粒度控制的需求。现有的防御措施——从激进的遗忘到简单的输出过滤——要么牺牲模型实用性,要么未能充分解决逐字泄露问题。我们引入 Obliviate,一种轻量级的后训练方法,通过 Kullback-Leibler 散度惩罚精细抑制指定序列的逐字复现,同时保持语义理解能力。Obliviate 首先识别记忆的片段,然后针对每个目标标记,通过最小化调整模型输出分布的方式来降低逐字复现的概率。同时,我们对非目标标记强制执行一致性损失,以保留模型的流畅性和任务性能。我们在四个流行的 6-8B 参数模型 (LLaMA-3.1、LLaMA-3.1-Instruct、Qwen-2.5 和 Yi-1.5) 上进行评估,使用合成记忆基准和有机版权段落(例如《麦克纳马》、《弗兰肯斯坦》、《爱丽丝》和《悲惨世界》)。在所有设置下,Obliviate 将逐字记忆降低了两个数量级(例如从数百个单词降至不足 12 个单词),同时在 HellaSwag、MMLU、TruthfulQA 和 Winogrande 等下游准确率下降不超过 1%。此外,我们将 Obliviate 与不同的遗忘和版权技术进行基准测试,使用 MUSE 和 CoTaEval 基准。这些结果将 Obliviate 定位为知识产权合规部署 LLM 的一种实用、高保真解决方案。

关键词

引用

@article{arxiv.2502.15010,
  title  = {Obliviate: Efficient Unmemorization for Protecting Intellectual Property in Large Language Models},
  author = {Mark Russinovich and Ahmed Salem},
  journal= {arXiv preprint arXiv:2502.15010},
  year   = {2025}
}