中文

重构 LLM 遗忘目标:梯度视角及突破

机器学习 2025-02-27 v1

摘要

大语言模型 (LLM) 应进行严格的审计以识别潜在风险,如版权和隐私侵权。一旦出现这些风险,及时更新以移除不希望的响应至关重要,以确保模型的合法性和安全性。这推动了最近的 LLM 遗忘研究,聚焦于在不损害其他非目标响应完整性的前提下擦除特定不希望的知识。现有研究引入了各种遗忘目标,以实现无需完全重新训练的 LLM 遗忘。然而,这些目标各自具有独特特性,目前尚无统一框架来充分理解它们。为填补这一空白,我们提出了梯度效应 (G-effect) 工具包,从梯度视角对遗忘目标对模型性能的影响进行量化。一个显著优势是其广泛的能力,从不同实例、更新步骤和 LLM 层面详细阐述遗忘影响。因此,G-effect 提供了新视角来识别现有遗忘目标的缺陷,进一步激发我们探索一系列新解决方案以缓解和改进这些缺陷。最后,我们概述了值得进一步研究的前景方向,旨在为社区推动这一重要领域的发展。

关键词

引用

@article{arxiv.2502.19301,
  title  = {Rethinking LLM Unlearning Objectives: A Gradient Perspective and Go Beyond},
  author = {Qizhou Wang and Jin Peng Zhou and Zhanke Zhou and Saebyeol Shin and Bo Han and Kilian Q. Weinberger},
  journal= {arXiv preprint arXiv:2502.19301},
  year   = {2025}
}