中文

面向鲁棒且参数高效的大语言模型知识遗忘

机器学习 2025-04-28 v5 计算与语言

摘要

大语言模型(LLMs)通过在大量文本语料库上的预训练展现了强大的推理和记忆能力。然而,这带来了隐私和版权侵犯的风险,凸显了对高效机器学习遗忘方法的需求,这些方法可以在不从头重新训练的情况下移除敏感数据。虽然梯度上升(GA)通常用于通过降低生成不想要内容的可能性来进行遗忘,但它会导致不稳定的优化和重新训练知识的灾难性遗忘。我们发现,将GA与低秩适应相结合会导致计算成本与生成性能之间的糟糕权衡。为应对这些挑战,我们提出了低秩知识遗忘(LoKU),一个用于LLM的鲁棒且高效遗忘的新框架。首先,我们引入倒置铰链损失,通过提升下一个最可能令牌的概率来抑制不想要的令牌,同时保持流畅性。其次,我们通过低秩近似并以相对费舍尔信息加权,开发了LoRA适配器的数据自适应初始化,从而将更新集中在移除目标知识的关键参数上。在训练数据提取挑战数据集上使用GPT-Neo模型以及在TOFU基准测试上使用Phi-1.5B和Llama2-7B模型的实验表明,我们的方法在保持推理和生成能力的同时有效移除了敏感信息,且影响最小。我们的实现可在 https://github.com/csm9493/efficient-llm-unlearning 获取。

关键词

引用

@article{arxiv.2408.06621,
  title  = {Towards Robust and Parameter-Efficient Knowledge Unlearning for LLMs},
  author = {Sungmin Cha and Sungjun Cho and Dasol Hwang and Moontae Lee},
  journal= {arXiv preprint arXiv:2408.06621},
  year   = {2025}
}

备注

ICLR 2025 camera-ready version