可靠机器遗忘:理论、算法与评估
机器学习
2025-12-09 v1
摘要
我们提出了新的方法,用于遗忘随机样本集和类别遗忘,显示其优于现有方法。我们的遗忘方法的主要驱动力是对忘记样本和保留样本上预测结果与重新训练模型的相似性。我们引入了对抗机器遗忘 (Adversarial Machine UNlearning, AMUN),该方法在基于 SOTA MIA 分数的图像分类中超越了先前的最先进方法。AMUN 通过对忘记样本的对应对抗样本进行微调来降低模型对忘记样本的置信度。通过理论分析,我们确定了影响 AMUN 性能的因素,包括平滑性。为便于训练具有受控 Lipschitz 常数的平滑模型,我们提出了 FastClip—a 可扩展的方法,对仿射层进行逐层谱范数剪切。在另一项研究中,我们发现增加的平滑性自然改善了对抗样本的迁移,从而支持上述第二个因素。遵循相同原则进行类别遗忘,我们发现现有方法在复制重新训练模型的行为方面失败, 我们引入了一个使用最近邻成员推断攻击 (MIA-NN) ,该攻击使用分配给相邻类别的概率来检测遗忘样本,并展示了此类方法的漏洞。我们 then 提出了一个微调目标,以通过近似 forget-class 输入的分布来缓解此漏泄, 该分布对应于模型从头重新训练后在剩余类别上产生的分布。为构建此近似,我们估计类别间相似性并相应地倾斜目标模型的分布。 resulting Tilted ReWeighting (TRW) 分布作为微调期间的期望目标。在多个基准测试中,TRW 在先前指标上与现有遗忘方法相匹配或超越。
引用
@article{arxiv.2512.06993,
title = {Toward Reliable Machine Unlearning: Theory, Algorithms, and Evaluation},
author = {Ali Ebrahimpour-Boroojeny},
journal= {arXiv preprint arXiv:2512.06993},
year = {2025}
}