利用对抗训练模型中潜层的脆弱性
机器学习
2019-06-27 v2 密码学与安全
计算机视觉与模式识别
机器学习
摘要
神经网络易受对抗攻击——即添加到输入上的微小视觉不可感知的精心构造噪声,会极大地改变输出。防御这些对抗攻击最有效的方法是对抗训练方法。我们分析了对抗训练的鲁棒模型,以研究其在潜层面对对抗攻击的脆弱性。我们的分析揭示,与对对抗攻击鲁棒的输入层相反,这些鲁棒模型的潜层对小幅度的对抗扰动高度敏感。利用这一信息,我们引入一种新技术潜层对抗训练(Latent Adversarial Training, LAT),其包含对对抗训练模型进行微调以确保特征层的鲁棒性。我们还提出潜层攻击(Latent Attack, LA),一种用于构造对抗样本的新算法。LAT在测试准确率上仅有微小提升,但在针对通用一阶对抗PGD攻击的对抗准确率上达到了state-of-the-art水平,这一点在MNIST、CIFAR-10、CIFAR-100数据集上得到了展示。
引用
@article{arxiv.1905.05186,
title = {Harnessing the Vulnerability of Latent Layers in Adversarially Trained Models},
author = {Mayank Singh and Abhishek Sinha and Nupur Kumari and Harshitha Machiraju and Balaji Krishnamurthy and Vineeth N Balasubramanian},
journal= {arXiv preprint arXiv:1905.05186},
year = {2019}
}
备注
Accepted at IJCAI 2019