对抗训练与盲点攻击的局限性
机器学习
2019-01-28 v1 密码学与安全
计算机视觉与模式识别
机器学习
摘要
Madry 等人(2018)提出的对抗训练过程是深度神经网络(DNNs)中防御对抗样本最有效的方法之一。在本文中,我们通过对抗训练的有效性(测试集上的鲁棒性)与测试点和由网络嵌入的训练数据流形之间的距离具有强相关性,来阐明对抗训练的实际性与困难性。相对远离该流形的测试样本更可能易受对抗攻击。因此,基于对抗训练的防御易受一类新攻击即“盲点攻击”的影响,其中输入图像位于训练数据经验分布的“盲点”(低密度区域)中,却仍在真实数据流形上。对于 MNIST,我们发现这些盲点可通过简单地缩放和平移图像像素值轻易找到。最重要的是,对于具有高位复数据流形的大型数据集(CIFAR、ImageNet 等),由于维数灾难与训练数据稀缺,对抗训练中盲点的存在使得对任何有效测试样本进行防御都十分困难。此外,我们发现盲点也存在于可证明防御中,包括 (Wong & Kolter, 2018) 与 (Sinha et al., 2018),因为这些可训练的鲁棒性证书只能在一有限训练集上实际优化。
引用
@article{arxiv.1901.04684,
title = {The Limitations of Adversarial Training and the Blind-Spot Attack},
author = {Huan Zhang and Hongge Chen and Zhao Song and Duane Boning and Inderjit S. Dhillon and Cho-Jui Hsieh},
journal= {arXiv preprint arXiv:1901.04684},
year = {2019}
}
备注
Accepted by International Conference on Learning Representations (ICLR) 2019. Huan Zhang and Hongge Chen contributed equally