中文

对抗性机器遗忘

机器学习 2024-06-13 v1 密码学与安全

摘要

本文聚焦于机器遗忘的挑战,旨在从机器学习模型中移除特定训练数据的影响。传统上,遗忘算法的发展与成员推断攻击(MIA)的发展并行,MIA是一种用于确定某个数据实例是否被用于训练的隐私威胁。然而,这两条线索密切相关:我们可以通过MIA对已移除数据的成功程度来审视机器遗忘。认识到这一联系,我们提出了一个将MIA整合到遗忘算法设计中的博弈论框架。具体来说,我们将遗忘问题建模为一个Stackelberg博弈,其中遗忘者努力从模型中遗忘特定的训练数据,而审计员则使用MIA来检测表面上已移除数据的痕迹。采用这种对抗性视角使得可以利用新的攻击进展,从而促进遗忘算法的设计。我们的框架在两个方面脱颖而出。首先,它采取对抗性方法,主动将攻击纳入遗忘算法的设计中。其次,它使用隐式微分来获取限制攻击者成功的梯度,从而有利于遗忘过程。我们通过实证结果证明了所提方法在机器遗忘中的有效性。

关键词

引用

@article{arxiv.2406.07687,
  title  = {Adversarial Machine Unlearning},
  author = {Zonglin Di and Sixie Yu and Yevgeniy Vorobeychik and Yang Liu},
  journal= {arXiv preprint arXiv:2406.07687},
  year   = {2024}
}