鲁棒还是隐私?对抗训练使模型更易受隐私攻击
机器学习
2019-06-18 v1 机器学习
摘要
对抗训练被提出作为提升深度学习模型对抗对抗攻击鲁棒性的一种方式。该训练方法提升了对抗攻击的鲁棒性,却增加了模型受隐私攻击的脆弱性。在本工作中,我们展示了模型反演攻击——直接从模型中提取训练数据,此前被认为难以实现——在攻击鲁棒训练模型时如何变得可行。传统训练模型的输入空间由对抗样本主导,即强烈激活某一类别但缺乏语义意义的数据点,这使得成功实施模型反演攻击十分困难。我们使用 CIFAR-10 数据集在三种不同模型反演攻击下展示了该效应:一种朴素梯度下降方法、不同尺度的基于梯度的方法,以及一种基于生成对抗网络的攻击。
引用
@article{arxiv.1906.06449,
title = {Robust or Private? Adversarial Training Makes Models More Vulnerable to Privacy Attacks},
author = {Felipe A. Mejia and Paul Gamble and Zigfried Hampel-Arias and Michael Lomnitz and Nina Lopatina and Lucas Tindall and Maria Alejandra Barrios},
journal= {arXiv preprint arXiv:1906.06449},
year = {2019}
}
备注
11 pages, 11 figures