中文

RESTOR:机器遗忘中的知识恢复

计算与语言 2025-05-27 v3

摘要

在网页规模语料库上训练的大语言模型可能会记忆包含错误信息、受版权保护材料或隐私敏感信息的不良数据。最近,已提出多种机器遗忘算法来消除此类数据点对已训练模型的影响——即,近似一个从一开始就未在这些数据点上训练过的模型。然而,评估遗忘算法的有效性仍然是一个开放的挑战。先前的工作依赖于启发式方法——例如验证模型能否不再复现要移除的特定信息,同时保持在不相关测试数据上的准确性。这些方法未能充分捕捉逆转数据点对已训练模型影响的完整效果。在这项工作中,我们提出了用于机器遗忘评估的RESTOR框架,该框架通过评估模型遗忘这些数据点所引入知识的能力,同时恢复模型若从未遇到这些数据点时的知识状态,来评估遗忘算法进行定向数据擦除的能力。RESTOR有助于揭示关于流行遗忘算法及其运作机制的一些新见解——例如,识别出某些算法仅强调遗忘而非恢复知识,以及定位遗忘目标可以提升遗忘性能。

关键词

引用

@article{arxiv.2411.00204,
  title  = {RESTOR: Knowledge Recovery in Machine Unlearning},
  author = {Keivan Rezaei and Khyathi Chandu and Soheil Feizi and Yejin Choi and Faeze Brahman and Abhilasha Ravichander},
  journal= {arXiv preprint arXiv:2411.00204},
  year   = {2025}
}

备注

Accepted to TMLR 2025