通过预测净化防御模型反演与成员推断攻击
密码学与安全
2020-08-21 v2 机器学习
摘要
神经网络容易受到数据推断攻击,如模型反演攻击和成员推断攻击,在这些攻击中,攻击者可以从目标分类器预测的置信度分数中推断出数据样本的重构和成员归属。在本文中,我们提出了一种统一的方法,即净化框架,以防御数据推断攻击。它通过降低目标分类器预测的置信度分数向量的离散度来对其进行净化。通过对抗学习,该净化器可以进一步专门用于防御特定的攻击。我们在基准数据集和分类器上评估了我们的方法。我们表明,当净化器专用于一种攻击时,它自然也能防御另一种攻击,这在经验上证明了这两种攻击之间的联系。该净化器能够有效防御这两种攻击。例如,它可以将成员推断准确率降低高达15%,并将模型反演误差增加高达4倍。此外,它造成的分类准确率下降不到0.4%,对置信度分数的失真不到5.5%。
引用
@article{arxiv.2005.03915,
title = {Defending Model Inversion and Membership Inference Attacks via Prediction Purification},
author = {Ziqi Yang and Bin Shao and Bohan Xuan and Ee-Chien Chang and Fan Zhang},
journal= {arXiv preprint arXiv:2005.03915},
year = {2020}
}
备注
updated experiments and results