判别对抗性遗忘
机器学习
2024-02-14 v2 人工智能
摘要
我们引入了一种基于最小 - 最大优化范式既定原则的新型机器遗忘框架。我们利用强大的成员推断攻击(MIA)能力,促进从训练好的模型中遗忘特定样本。我们考虑了两个网络的场景:攻击者 和训练好的防御者 在对抗目标中相互对抗,其中攻击者旨在挖掘待遗忘数据的信息以推断成员资格,而防御者通过遗忘来防御网络免受攻击,同时保持其总体性能。该算法可以使用反向传播进行端到端训练,遵循更新攻击者和防御者的著名迭代最小 - 最大方法。此外,我们 Incorporate 了一个自监督目标,有效解决了遗忘集和验证集之间的特征空间差异,增强了遗忘性能。我们提出的算法在标准机器遗忘数据集上,无论是随机样本遗忘还是类级遗忘方案,都紧密逼近从头重新训练的理想基准。具体而言,在类遗忘方案中,该方法表现出近乎最优的性能,并在所有指标和多种网络剪枝策略下,全面克服了随机样本遗忘方案中的已知方法。
引用
@article{arxiv.2402.06864,
title = {Discriminative Adversarial Unlearning},
author = {Rohan Sharma and Shijie Zhou and Kaiyi Ji and Changyou Chen},
journal= {arXiv preprint arXiv:2402.06864},
year = {2024}
}
备注
13 pages including references, 2 tables, 2 figures and 1 algorithm