遗忘并非删除:探究大语言模型中机器遗忘的可逆性
计算与语言
2026-05-19 v3 人工智能
密码学与安全
机器学习
摘要
大语言模型(LLM)中的遗忘旨在移除指定数据,但其有效性通常通过准确率和困惑度等任务级指标来评估。我们表明这些指标可能具有误导性,因为模型看似已经遗忘,但其原始行为可通过极少的微调轻易恢复。这种可逆性表明信息仅仅是被抑制,而非真正被擦除。为解决这一关键的评估缺口,我们引入了一个表示级分析框架。我们的工具包包括PCA相似度与偏移、中心核对齐(CKA)和Fisher信息,并辅以一个汇总指标——平均PCA距离,来衡量表示漂移。将此框架应用于多种遗忘方法、数据领域和LLM,我们基于其可逆性和灾难性识别出四种不同的遗忘模式。我们比较了恢复策略,并表明重学习效率依赖于数据源。我们还发现,不可逆且非灾难性的遗忘极具挑战性。通过探究遗忘的极限,我们识别出一个看似不可逆、有针对性的遗忘案例,为更鲁棒的擦除算法提供了见解。总体而言,我们的发现暴露了当前评估的缺口,并为可信的遗忘建立了表示级基础。
引用
@article{arxiv.2505.16831,
title = {Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs},
author = {Xiaoyu Xu and Xiang Yue and Yang Liu and Qingqing Ye and Huadi Zheng and Peizhao Hu and Minxin Du and Haibo Hu},
journal= {arXiv preprint arXiv:2505.16831},
year = {2026}
}
备注
ICML 2026, accepted to appear