挑战遗忘:揭示机器遗忘中的最坏情况遗忘集
机器学习
2024-07-10 v4 人工智能
计算机视觉与模式识别
摘要
可信机器学习(ML)社区日益认识到,模型需要具备在训练后选择性“遗忘”数据点的能力。这引出了机器遗忘(Machine Unlearning, MU)问题,旨在消除选定数据点对模型性能的影响,同时在遗忘后保持模型的实用性。尽管已有多种用于数据影响擦除的 MU 方法,但评估主要集中在随机数据遗忘上,忽略了关于应选择哪个子集以真正衡量遗忘性能真实性的关键问题。为解决这一问题,我们从对抗视角引入了 MU 的新评估角度。我们提出识别对影响擦除构成最大挑战的数据子集,即 pinpointing 最坏情况遗忘集。利用双层优化原理,我们在上层优化层面放大遗忘挑战以模拟最坏情况场景,同时在下层进行标准训练和遗忘,从而实现数据影响擦除与模型实用性之间的平衡。我们的提案提供了对 MU 鲁棒性和有效性的最坏情况评估。通过对不同数据集(包括 CIFAR-10、CIFAR-100、CelebA、Tiny ImageNet 和 ImageNet)和模型(包括图像分类器和生成模型)的广泛实验,我们揭示了现有(近似)遗忘策略的关键优缺点。我们的结果阐明了 MU 在实际应用中的复杂挑战,指导未来开发更准确、更鲁棒的遗忘算法。代码地址:https://github.com/OPTML-Group/Unlearn-WorstCase。
引用
@article{arxiv.2403.07362,
title = {Challenging Forgets: Unveiling the Worst-Case Forget Sets in Machine Unlearning},
author = {Chongyu Fan and Jiancheng Liu and Alfred Hero and Sijia Liu},
journal= {arXiv preprint arXiv:2403.07362},
year = {2024}
}
备注
Accepted by ECCV 2024