中文

MUSE:语言模型的六维机器遗忘评估

计算与语言 2024-07-16 v2 人工智能

摘要

语言模型在大量文本数据上进行训练,这些数据可能包含私人和受版权保护的内容。数据所有者可能出于隐私或版权考虑,要求从其训练好的模型中移除其数据。然而,在现代模型中,精确地仅遗忘这些数据点(即,移除数据后重新训练)是难以处理的。这导致了许多近似遗忘算法的发展。传统上,对这些算法有效性的评估范围狭窄,未能从模型部署者和数据所有者的角度精确量化算法的成功和实用性。我们通过提出MUSE来解决这个问题,这是一个全面的机器遗忘评估基准,枚举了遗忘模型的六个不同的理想属性:(1) 无逐字记忆,(2) 无知识记忆,(3) 无隐私泄露,(4) 对非移除数据的效用保持,(5) 关于移除请求规模的可扩展性,以及(6) 对连续遗忘请求的可持续性。使用这些标准,我们评估了八种流行的遗忘算法在7B参数语言模型上遗忘《哈利·波特》书籍和新闻文章的效果。我们的结果表明,大多数算法可以在不同程度上防止逐字记忆和知识记忆,但只有一种算法不会导致严重的隐私泄露。此外,现有算法未能满足部署者的期望,因为它们常常降低通用模型效用,并且不能可持续地处理连续的遗忘请求或大规模内容移除。我们的发现指出了现有语言模型遗忘算法实用性的关键问题,我们发布了我们的基准以促进进一步评估:muse-bench.github.io

关键词

引用

@article{arxiv.2407.06460,
  title  = {MUSE: Machine Unlearning Six-Way Evaluation for Language Models},
  author = {Weijia Shi and Jaechan Lee and Yangsibo Huang and Sadhika Malladi and Jieyu Zhao and Ari Holtzman and Daogao Liu and Luke Zettlemoyer and Noah A. Smith and Chiyuan Zhang},
  journal= {arXiv preprint arXiv:2407.06460},
  year   = {2024}
}