关注 LLM 机器遗忘:隐藏风险与补救措施
密码学与安全
2025-06-03 v1
摘要
尽管大型语言模型(LLM)在广泛的任务中展现出了令人印象深刻的能力,但人们对训练期间滥用敏感、受版权保护或有害数据的担忧日益增加。为了解决这些问题,机器遗忘技术被开发出来,以在不从头开始重新训练的情况下消除特定数据的影响。然而,本文揭示了基于微调的机器遗忘中的一个关键漏洞:恶意用户可以伪造被篡改的遗忘请求,从而隐蔽地降低模型对良性用户的效用。我们通过红队隐蔽攻击(SA)展示了这一风险,该攻击受现有机器遗忘的两个关键局限性(无法约束遗忘效果的范围以及无法区分良性标记与遗忘信号)启发。先前的工作表明,被遗忘的模型倾向于将遗忘数据记忆为遗忘信号,并在输入中出现遗忘信号时以幻觉或假装无知作为回应。通过微妙地增加遗忘数据中常见良性标记的出现频率,SA增强了良性标记与遗忘信号之间的联系。因此,当正常用户在其提示中包含此类标记时,模型会表现出遗忘行为,导致非预期的效用下降。为了解决这一漏洞,我们提出了范围感知遗忘(SU),这是一种轻量级增强方法,在遗忘目标中引入范围项,鼓励模型将遗忘效果局部化。我们的方法不需要额外的数据处理,可与现有的微调框架无缝集成,并显著提高了对SA的鲁棒性。大量实验验证了SA和SU的有效性。
引用
@article{arxiv.2506.00359,
title = {Keeping an Eye on LLM Unlearning: The Hidden Risk and Remedy},
author = {Jie Ren and Zhenwei Dai and Xianfeng Tang and Yue Xing and Shenglai Zeng and Hui Liu and Jingying Zeng and Qiankun Peng and Samarth Varshney and Suhang Wang and Qi He and Charu C. Aggarwal and Hui Liu},
journal= {arXiv preprint arXiv:2506.00359},
year = {2025}
}