中文

不变性使 LLM 机器遗忘即使面对不可预见的下游微调也具有韧性

机器学习 2025-10-14 v2

摘要

机器遗忘通过选择性地移除目标知识同时保留效用,为大型语言模型(LLM)的隐私和安全问题提供了一种有前景的解决方案。然而,当前的方法对下游微调高度敏感,这可以迅速恢复被遗忘的信息——即使是来自不相关的任务。为了解决这个问题,我们受不变风险最小化(IRM)启发,首次将不变性引入机器遗忘。基于这一原则,我们提出了不变 LLM 机器遗忘(ILU),一个增强鲁棒性的基于正则化的框架。值得注意的是,ILU 对各种微调任务具有良好的泛化能力,即使仅使用单一数据集进行训练。我们还提供了任务向量分析,以进一步阐明 ILU 有效性的原理。在 WMDP 和 MUSE 基准上的大量实验表明,ILU 显著优于最先进的机器遗忘方法,包括负偏好优化(NPO)和用于机器遗忘的表示误导(RMU)。值得注意的是,ILU 在各种下游微调场景(例如,数学、复述检测和情感分析)中实现了卓越的机器遗忘鲁棒性,同时保留了微调性能。

关键词

引用

@article{arxiv.2506.01339,
  title  = {Invariance Makes LLM Unlearning Resilient Even to Unanticipated Downstream Fine-Tuning},
  author = {Changsheng Wang and Yihua Zhang and Jinghan Jia and Parikshit Ram and Dennis Wei and Yuguang Yao and Soumyadeep Pal and Nathalie Baracaldo and Sijia Liu},
  journal= {arXiv preprint arXiv:2506.01339},
  year   = {2025}
}

备注

Accepted by ICML 2025