通过对抗训练学习更鲁棒的特征
机器学习
2018-04-24 v1 人工智能
机器学习
摘要
近年来,人们发现神经网络很容易被对抗样本欺骗,这在某些安全关键应用中是潜在的安全隐患。许多研究者提出了各种方法使神经网络对白盒对抗攻击更加鲁棒,但迄今为止尚未找到有效的方法。在这篇短文中,我们关注神经网络所学特征的鲁棒性。我们表明神经网络学到的特征并不鲁棒,并且发现所学特征的鲁棒性与神经网络抵御对抗样本的能力密切相关。我们还发现,针对快速梯度符号法 (FGSM) 的对抗训练并不能使学到的特征非常鲁棒,即使它能使训练后的网络对 FGSM 攻击非常抵抗。然后我们提出了一种可视为对抗训练扩展的方法,用于训练神经网络学习更鲁棒的特征。我们在 MNIST 和 CIFAR-10 上进行了实验来评估我们的方法,实验结果表明该方法大幅提升了所学特征的鲁棒性和对对抗攻击的抵抗能力。
引用
@article{arxiv.1804.07757,
title = {Learning More Robust Features with Adversarial Training},
author = {Shuangtao Li and Yuanke Chen and Yanlin Peng and Lin Bai},
journal= {arXiv preprint arXiv:1804.07757},
year = {2018}
}