中文

利用对抗训练模型中潜层的脆弱性

机器学习 2019-06-27 v2 密码学与安全 计算机视觉与模式识别 机器学习

摘要

神经网络易受对抗攻击——即添加到输入上的微小视觉不可感知的精心构造噪声,会极大地改变输出。防御这些对抗攻击最有效的方法是对抗训练方法。我们分析了对抗训练的鲁棒模型,以研究其在潜层面对对抗攻击的脆弱性。我们的分析揭示,与对对抗攻击鲁棒的输入层相反,这些鲁棒模型的潜层对小幅度的对抗扰动高度敏感。利用这一信息,我们引入一种新技术潜层对抗训练(Latent Adversarial Training, LAT),其包含对对抗训练模型进行微调以确保特征层的鲁棒性。我们还提出潜层攻击(Latent Attack, LA),一种用于构造对抗样本的新算法。LAT在测试准确率上仅有微小提升,但在针对通用一阶对抗PGD攻击的对抗准确率上达到了state-of-the-art水平,这一点在MNIST、CIFAR-10、CIFAR-100数据集上得到了展示。

关键词

引用

@article{arxiv.1905.05186,
  title  = {Harnessing the Vulnerability of Latent Layers in Adversarially Trained Models},
  author = {Mayank Singh and Abhishek Sinha and Nupur Kumari and Harshitha Machiraju and Balaji Krishnamurthy and Vineeth N Balasubramanian},
  journal= {arXiv preprint arXiv:1905.05186},
  year   = {2019}
}

备注

Accepted at IJCAI 2019