中文

基于神经激活重定向的LLM遗忘

机器学习 2025-10-09 v2 人工智能

摘要

从LLM中选择性地移除知识的能力高度重要。然而,现有方法往往难以在遗忘效果与保持模型实用性之间取得平衡,缺乏在推理时对基线模型行为的可控性,仿佛模型从未见过被遗忘的数据。在本文中,我们提出了LUNAR,一种基于线性表示假设的新型遗忘方法,通过将遗忘数据表示重定向到表达无法回答的激活区域来实现。我们表明,对比特征并非有效激活重定向的必需条件,LUNAR实现了最先进的遗忘性能和卓越的可控性。具体而言,LUNAR在 various base models 上实现了2.9倍至11.7倍的遗忘效能与模型实用性综合得分(Deviation Score)提升。此外,LUNAR有效地将参数更新减少到单个低投影矩阵,一种新颖的设计显著提高了效率(提升20倍)和鲁棒性。最后,我们展示了LUNAR对抗白盒攻击具有鲁棒性,并且在实际场景中具有多样性,包括处理顺序遗忘请求。

关键词

引用

@article{arxiv.2502.07218,
  title  = {LLM Unlearning via Neural Activation Redirection},
  author = {William F. Shen and Xinchi Qiu and Meghdad Kurmanji and Alex Iacob and Lorenzo Sani and Yihong Chen and Nicola Cancedda and Nicholas D. Lane},
  journal= {arXiv preprint arXiv:2502.07218},
  year   = {2025}
}