中文

面向大语言模型的表示引导参数高效忘忘

计算与语言 2026-04-21 v1

摘要

大型语言模型(LLM)常会记忆敏感或有害信息, necessitating effective machine unlearning 技术。虽然现有的 parameter-efficient unlearning 方法显示出前景,但它们仍在忘记-保留之间的权衡上存在挑战。这可以归因于它们依赖参数重要性指标来识别仅对忘记集重要的 参数,而这在本质上受限于superposition 现象。由于 LLM 参数的多义性,此类重要性指标可能难以消除与忘记集和保留集相关联的 参数。在本 work 中,我们提出了基于表示引导的低秩忘忘(REGLU),一种新方法,利用表示空间的几何属性以实现稳健且精确的忘忘。首先,我们发展了一种表示引导的 LoRA 初始化,用于识别选择性忘记的最优子空间。其次,我们引入一种正则化损失,以约束 LoRA 更新的输出位于保留集表示子空间的正交补中,从而最大限地减少对模型在保留集上的性能的干扰。我们在 TOFU 和 WMDP 基准测试中对多种模型进行评估。我们的结果表明,REGLU 在各类 SOTA baseline 上 consistently 优于,实现了卓越的忘记质量,同时保持更高的模型效用。

关键词

引用

@article{arxiv.2604.17396,
  title  = {Representation-Guided Parameter-Efficient LLM Unlearning},
  author = {Zeguan Xiao and Lang Mo and Yun Chen and Lei Yang and Jiehui Zhao and Lili Yang and Guanhua Chen},
  journal= {arXiv preprint arXiv:2604.17396},
  year   = {2026}
}

备注

Findings of ACL 2026