中文

基于推理的可解释 LLM 遗忘

机器学习 2026-03-12 v1 人工智能 计算与语言

摘要

LLM 遗忘对于缓解预训练大型语言模型 (LLM) 中的安全、版权和隐私问题至关重要。相较于偏好对齐,它提供了更明确的方式,通过删除由特定遗忘数据集描述的不良知识。先前研究中,梯度上升 (GA) 及其变体在实现遗忘方面表现突出,但其无目标性质导致一般能力意外降低、知识删除不彻底以及生成不连贯响应等问题。我们认为,这些问题源于缺乏对模型应遗忘什么以及如何遗忘的明确指导。为填补这一空白,我们提出一种新型遗忘目标——推理导向遗忘目标,既满足指定的遗忘范围,又满足指定的遗忘后响应。基于此,我们提出面向推理的遗忘 (TRU),该方法将推理导向遗忘目标作为指导。我们采用交叉熵监督损失结合 GA 损失,使模型学习推理能力,以实现精准知识删除,同时保留无关能力。我们在多个基准和 LLM 架构上对 TRU 与强基准进行评估,发现其在可靠遗忘的同时保持一般能力方面表现更佳。此外,TRU 在多样化攻击情景下表现出优异鲁棒性,这源于通过推理导向目标学习到的推理能力。总体而言,本研究确立了以推理为导向的遗忘作为可靠且可解释的 LLM 遗忘范式。

关键词

引用

@article{arxiv.2603.09980,
  title  = {Explainable LLM Unlearning Through Reasoning},
  author = {Junfeng Liao and Qizhou Wang and Shanshan Ye and Xin Yu and Ling Chen and Zhen Fang},
  journal= {arXiv preprint arXiv:2603.09980},
  year   = {2026}
}