忘记与焚毁:对抗性机器忘卸请求破坏模型准确性
密码学与安全
2024-10-15 v1
摘要
机器忘卸算法旨在从模型中选择性地删除训练数据,已成为应对日益增长隐私关注的有前景的方法。本文暴露了一个关键且尚未充分被探讨的部署漏洞:即假设请求删除的数据始终是原始训练集的一部分。我们提出一种威胁模型,攻击者可通过提交针对训练集中不存在数据的对抗性忘卸请求来降低模型准确性。我们提出了白盒和黑盒攻击算法,并通过在CIFAR-10和ImageNet数据集上进行案例研究来评估它们,针对一系列广泛使用的忘卸方法。我们的结果显示,攻击后测试准确性极其糟糕:针对白盒攻击,CIFAR-10为3.6%,ImageNet为0.4%;针对黑盒攻击,CIFAR-10为8.5%,ImageNet为1.3%。此外,我们评估了各种验证机制以检测忘卸请求的合法性,并揭示了其中的挑战,因为大多数机制在不严重损害处理有效请求能力的情况下,难以检测到隐蔽的攻击。这些发现凸显了迫切需要研究更稳健的请求验证方法和忘卸协议的需求,若机器忘卸系统的部署愈来愈普遍。
引用
@article{arxiv.2410.09591,
title = {Unlearn and Burn: Adversarial Machine Unlearning Requests Destroy Model Accuracy},
author = {Yangsibo Huang and Daogao Liu and Lynn Chua and Badih Ghazi and Pritish Kamath and Ravi Kumar and Pasin Manurangsi and Milad Nasr and Amer Sinha and Chiyuan Zhang},
journal= {arXiv preprint arXiv:2410.09591},
year = {2024}
}