通过数据投毒防御神经网络模型反演攻击
密码学与安全
2024-12-11 v1
摘要
模型反演攻击通过从模型输出中重建敏感数据,对机器学习模型构成严重的隐私威胁。虽然已提出各种防御措施来对抗这些攻击,但它们通常以牺牲分类器的效用为代价,从而在隐私保护和模型效用之间形成了具有挑战性的权衡。此外,大多数现有防御需要重新训练分类器以增强鲁棒性,这对于大规模成熟模型而言是不切实际的。本文提出了一种新的防御机制,以更好地平衡隐私和效用,特别是针对使用机器学习模型(即反演模型)来重建私有数据的攻击者。借鉴数据投毒攻击可以破坏机器学习模型性能的思路,我们提出了一种利用数据投毒来污染反演模型训练数据的策略,从而防止模型反演攻击。提出了两种防御方法。第一种称为面向所有输出向量的标签保持投毒攻击(LPA),涉及对所有输出向量的微小扰动同时保持其标签。我们的结果表明,通过数据投毒方法引入的这些微小扰动显著增加了数据重建的难度,同时未损害分类器的效用。随后,我们引入第二种方法,即面向部分输出向量的标签翻转投毒(LFP),该方法选择性地扰动一小部分输出向量并在过程中改变其标签。实证结果表明,LPA显著有效,优于当前的最先进防御方法。我们基于数据投毒的防御提供了一种新的无需重新训练的防御范式,保留了被攻击分类器的效用。
引用
@article{arxiv.2412.07575,
title = {Defending Against Neural Network Model Inversion Attacks via Data Poisoning},
author = {Shuai Zhou and Dayong Ye and Tianqing Zhu and Wanlei Zhou},
journal= {arXiv preprint arXiv:2412.07575},
year = {2024}
}