中文

并非所有数据的遗忘效果都同等

计算与语言 2025-09-03 v6

摘要

机器遗忘关注的是从已训练模型中移除从特定数据点学到的知识的任务。在大语言模型(LLMs)的背景下,遗忘近期受到了越来越多的关注,特别是出于隐私目的从模型中移除有关命名实体的知识。尽管已有多种方法被提出来解决遗忘问题,但大多数现有方法将所有需要遗忘的数据点同等对待,即遗忘“蒙特利尔是加拿大的一座城市”与遗忘“本文第一作者的電話号码”被完全相同地处理。在本工作中,我们表明这种“所有数据平等”的假设在 LLM 遗忘中并不成立。我们研究了遗忘的成功率如何取决于我们想要遗忘的知识在模型预训练数据中的出现频率,发现频率强烈影响遗忘效果,即越频繁的知识越难被遗忘。此外,我们揭示了基于概率和基于生成的遗忘评估之间的不一致性,并表明该问题随着模型变大而恶化。总体而言,我们的实验强调了对 LLM 遗忘需要更好的评估实践和考虑模型训练数据的新方法。

关键词

引用

@article{arxiv.2504.05058,
  title  = {Not All Data Are Unlearned Equally},
  author = {Aravind Krishnan and Siva Reddy and Marius Mosbach},
  journal= {arXiv preprint arXiv:2504.05058},
  year   = {2025}
}

备注

Accepted at COLM 2025