中文

通过随机扰动提升 LLM 遗忘的鲁棒性

计算与语言 2026-04-21 v6

摘要

在本文中,我们展示了当前的 LLM 遗忘方法本质上会降低模型的鲁棒性,导致即使保留查询(retain-query)中存在单个非对抗性遗忘令牌(forget-token),模型也会出现异常行为。为了理解其潜在原因,我们提出了一个新颖的理论框架,将遗忘过程重新构建为后门攻击与防御问题:我们阐明了遗忘过程如何在不经意间学会将遗忘令牌(后门触发器)与目标表示(目标标签)对齐。因此,遗忘令牌充当后门触发器,当其在保留查询中被激活时,会导致遗忘后模型的行为受到干扰,类似于成功的后门攻击。LLM 遗忘方法本身会毒化模型,使其更容易受到遗忘令牌的影响,并且是隐藏而非擦除目标知识,这一观点描述了它们的真实机制。为了缓解遗忘过程造成的脆弱性,我们将保留过程重新解释为后门防御,并提出了随机噪声增强(Random Noise Augmentation, RNA),这是一种轻量级、与模型和方法无关的方法,在提升遗忘后模型的鲁棒性方面具有理论保证。大量实验表明,RNA 显著提升了遗忘后模型的鲁棒性,同时保持了遗忘和保留性能。这种后门攻防框架为遗忘机制提供了深刻见解,可为未来提升遗忘鲁棒性的研究方向提供启示。

关键词

引用

@article{arxiv.2501.19202,
  title  = {Improving LLM Unlearning Robustness via Random Perturbations},
  author = {Dang Huu-Tien and Hoang Thanh-Tung and Anh Bui and Minh-Phuong Nguyen and Le-Minh Nguyen and Naoya Inoue},
  journal= {arXiv preprint arXiv:2501.19202},
  year   = {2026}
}

备注

Accepted by Transactions on Machine Learning Research