中文

判别对抗性遗忘

机器学习 2024-02-14 v2 人工智能

摘要

我们引入了一种基于最小 - 最大优化范式既定原则的新型机器遗忘框架。我们利用强大的成员推断攻击(MIA)能力,促进从训练好的模型中遗忘特定样本。我们考虑了两个网络的场景:攻击者 A\mathbf{A} 和训练好的防御者 D\mathbf{D} 在对抗目标中相互对抗,其中攻击者旨在挖掘待遗忘数据的信息以推断成员资格,而防御者通过遗忘来防御网络免受攻击,同时保持其总体性能。该算法可以使用反向传播进行端到端训练,遵循更新攻击者和防御者的著名迭代最小 - 最大方法。此外,我们 Incorporate 了一个自监督目标,有效解决了遗忘集和验证集之间的特征空间差异,增强了遗忘性能。我们提出的算法在标准机器遗忘数据集上,无论是随机样本遗忘还是类级遗忘方案,都紧密逼近从头重新训练的理想基准。具体而言,在类遗忘方案中,该方法表现出近乎最优的性能,并在所有指标和多种网络剪枝策略下,全面克服了随机样本遗忘方案中的已知方法。

关键词

引用

@article{arxiv.2402.06864,
  title  = {Discriminative Adversarial Unlearning},
  author = {Rohan Sharma and Shijie Zhou and Kaiyi Ji and Changyou Chen},
  journal= {arXiv preprint arXiv:2402.06864},
  year   = {2024}
}

备注

13 pages including references, 2 tables, 2 figures and 1 algorithm