中文

编辑即遗忘:知识编辑方法是大语言模型遗忘的强基线吗?

机器学习 2025-05-27 v1

摘要

大语言模型(LLM)遗忘,即从 LLM 中选择性地移除信息,对于负责任的模型部署至关重要。不同的是,LLM 知识编辑旨在修改 LLM 的知识而非移除它。尽管编辑和遗忘似乎是两项截然不同的任务,我们发现它们之间存在紧密联系。在本文中,我们将遗忘概念化为编辑的一个特例,即信息被修改为拒绝或“空集”\emptyset 响应,表示其被移除。因此,本文探讨知识编辑技术是否是 LLM 遗忘的强基线。我们在预训练和微调知识上评估了现有最先进的(SOTA)编辑方法(如 ROME、MEMIT、GRACE、WISE 和 AlphaEdit)与现有遗忘方法的对比。结果表明,某些编辑方法,尤其是 WISE 和 AlphaEdit,是有效的遗忘基线,特别是对于预训练知识,并且在生成人类对齐的拒绝回答方面表现出色。为了更好地将编辑方法适配于遗忘应用,我们提出了包括自我改进和查询合并在内的实用方案。前者利用 LLM 自身的上下文学习能力来构建更符合人类对齐的遗忘目标,后者使 ROME 和 MEMIT 在遗忘更长的样本序列时表现良好。我们提倡遗忘社区采用 SOTA 编辑方法作为基线,并从编辑视角探索遗忘,以实现更全面的 LLM 记忆控制。

关键词

引用

@article{arxiv.2505.19855,
  title  = {Editing as Unlearning: Are Knowledge Editing Methods Strong Baselines for Large Language Model Unlearning?},
  author = {Zexi Li and Xiangzhu Wang and William F. Shen and Meghdad Kurmanji and Xinchi Qiu and Dongqi Cai and Chao Wu and Nicholas D. Lane},
  journal= {arXiv preprint arXiv:2505.19855},
  year   = {2025}
}

备注

Preprint