中文

无所不记的擦除:大语言模型中的隐式知识遗忘

计算与语言 2025-10-10 v3 机器学习

摘要

本文聚焦大语言模型中的知识遗忘问题,特别关注其泛化性,确保模型不仅遗忘特定训练样本,还遗忘相关的隐式知识。为此,我们首先识别了更广泛的遗忘范围,包括目标数据和逻辑关联样本,包括改写版、主语替换、关系反转以及一跳推理数据。随后,我们对15种最先进方法在三个数据集上的严格评估,揭示未遗忘的模型仍会回复改写答案,并在中间层保留目标事实。这促使我们提出一种初步的更广泛隐式知识遗忘方法——PerMU,即一种基于概率扰动的遗忘范式。PerMU模拟对抗遗忘样本,以消除与事实相关的标记在logit分布中的概率,从而整体降低所有答案相关标记的概率。我们在多样化的数据集上进行实验,包括TOFU、Harry Potter、ZsRE、WMDP和MUSE,使用模型规模从13亿到130二不等。结果表明,PerMU在遗忘原始目标数据方面实现了最高可达50.40%的提升,同时在遗忘隐式知识方面实现了40.73%的提升。我们的代码可在https://github.com/MaybeLizzy/PERMU查阅。

关键词

引用

@article{arxiv.2502.19982,
  title  = {Erasing Without Remembering: Implicit Knowledge Forgetting in Large Language Models},
  author = {Huazheng Wang and Yongcheng Jing and Haifeng Sun and Yingjie Wang and Jingyu Wang and Jianxin Liao and Dacheng Tao},
  journal= {arXiv preprint arXiv:2502.19982},
  year   = {2025}
}