中文

SoK:大语言模型的机器遗忘

机器学习 2025-06-12 v1 密码学与安全

摘要

大语言模型(LLM)遗忘已成为机器学习中的一个关键课题,旨在在不从头重新训练模型的情况下消除特定训练数据或知识的影响。已提出多种技术,包括梯度上升、模型编辑和重新引导隐藏表示。尽管现有的综述通常按技术特征对这些方法进行分类,但这些分类往往忽略了一个更基本的维度:遗忘的底层意图——它究竟是寻求真正移除内部知识,还是仅仅抑制其行为效应。在本文中,我们基于这种以意图为导向的视角提出了一种新的分类法。基于这一分类法,我们做出了三项关键贡献。首先,我们重新审视了最近的发现,即许多移除方法在功能上可能表现为抑制,并探讨真正移除是否必要或可实现。其次,我们综述了现有的评估策略,识别当前指标和基准的局限性,并提出开发更可靠且与意图一致的评估方法的方向。第三,我们强调了实际挑战——如可扩展性和对顺序遗忘的支持——这些挑战目前阻碍了遗忘方法的更广泛部署。总之,这项工作提供了一个理解和推进生成 AI 中遗忘的全面框架,旨在支持未来研究并指导有关数据移除和隐私的政策决策。

关键词

引用

@article{arxiv.2506.09227,
  title  = {SoK: Machine Unlearning for Large Language Models},
  author = {Jie Ren and Yue Xing and Yingqian Cui and Charu C. Aggarwal and Hui Liu},
  journal= {arXiv preprint arXiv:2506.09227},
  year   = {2025}
}