学习你想遗忘的内容:针对机器遗忘的遗忘反演攻击
密码学与安全
2024-04-05 v1
摘要
机器遗忘已成为实现“被遗忘权”的一种极具前景的解决方案,根据该权利,个人可以要求从机器学习模型中删除其数据。然而,现有的机器遗忘研究主要关注遗忘方法的有效性和效率,而忽略了对遗忘过程中隐私漏洞的考察。由于攻击者可以获取模型的两类版本,即原始模型和遗忘模型,机器遗忘开辟了新的攻击面。在本文中,我们首次开展研究,探讨机器遗忘在多大程度上会泄露被遗忘数据的机密内容。具体而言,在机器学习即服务设置下,我们提出了遗忘反演攻击,该攻击仅需访问原始模型和遗忘模型即可揭示被遗忘样本的特征与标签信息。通过在各种模型架构的基准数据集上,以及针对精确和近似代表性遗忘方法的大量实验,评估了所提出的遗忘反演攻击的有效性。实验结果表明,所提出的攻击能够揭示被遗忘数据的敏感信息。因此,我们确定了三种可能的防御措施,这些措施有助于缓解所提出的攻击,但代价是降低了遗忘模型的效用。本文的研究揭示了机器遗忘与被遗忘数据隐私之间一个尚未充分探索的差距,凸显了需要精心设计机制以在不泄露被遗忘数据信息的情况下实现遗忘。
引用
@article{arxiv.2404.03233,
title = {Learn What You Want to Unlearn: Unlearning Inversion Attacks against Machine Unlearning},
author = {Hongsheng Hu and Shuo Wang and Tian Dong and Minhui Xue},
journal= {arXiv preprint arXiv:2404.03233},
year = {2024}
}
备注
To Appear in the 45th IEEE Symposium on Security and Privacy, May 20-23, 2024