中文

论输出分布重加权对有效类别遗忘的必要性

机器学习 2025-11-17 v4 人工智能

摘要

在本文中,我们揭示了类别遗忘评估中的一个重大缺陷:忽视潜在的类别几何结构可能导致隐私泄露。我们进一步提出了一种简单而有效的解决方案来缓解此问题。我们引入了一种基于最近邻的成员推理攻击(MIA-NN),该攻击利用模型分配给相邻类别的概率来检测被遗忘的样本。我们的实验表明,现有的遗忘方法在多个数据集上均易受 MIA-NN 攻击。随后,我们提出了一种新的微调目标,通过为遗忘类输入逼近一个从头重新训练的模型在剩余类别上产生的分布,来缓解这种隐私泄露。为构建此逼近,我们估计类间相似性并相应地倾斜目标模型的分布。由此得到的倾斜重加权(TRW)分布作为微调期间的期望分布。我们还表明,在多个基准测试上,TRW 在先前的遗忘指标上与现有遗忘方法持平或超越。更具体地,在 CIFAR-10 上,与每个类别的 SOTA 方法相比,它在 U-LiRA 和 MIA-NN 得分上分别将与重训练模型的差距缩小了 19% 和 46%。

关键词

引用

@article{arxiv.2506.20893,
  title  = {On the Necessity of Output Distribution Reweighting for Effective Class Unlearning},
  author = {Ali Ebrahimpour-Boroojeny and Yian Wang and Hari Sundaram},
  journal= {arXiv preprint arXiv:2506.20893},
  year   = {2025}
}