迈向 MNIST 上首个对抗鲁棒神经网络模型
计算机视觉与模式识别
2018-09-21 v3
摘要
尽管付出了诸多努力,深度神经网络仍极易受到微小输入扰动的影响,即便是计算机视觉中最常见的玩具数据集之一 MNIST,也不存在任何对抗扰动较大且对人类具有语义意义的神经网络模型。我们表明,即便是被广泛认可且迄今最成功的 Madry 等人防御方法也:(1) 在 L-infinity 度量上过拟合(其对 L2 和 L0 扰动高度敏感),(2) 以高置信度对无法识别的图像进行分类,(3) 性能仅比简单的输入二值化略好,以及 (4) 所产生的对抗扰动对人类而言几乎无意义。这些结果表明,就对抗鲁棒性而言,MNIST 远未被解决。我们提出了一种新颖的鲁棒分类模型,该模型利用学习到的类条件数据分布通过合成进行分析。我们推导了鲁棒性的界,并竭尽全力使用最大效力的对抗攻击对我们的模型进行经验评估:(a) 针对若干不同的 Lp 范数应用基于决策、基于分数、基于梯度和基于迁移的攻击,(b) 设计一种利用我们所防御模型结构的新型攻击,以及 (c) 设计一种旨在最小化被扰动像素数(L0)的新型基于决策的攻击。结果表明,我们的方法在 MNIST 上针对 L0、L2 和 L-infinity 扰动取得了最先进的鲁棒性,并且我们证明大多数对抗样本被强烈扰动至原始类别与对抗类别之间的感知边界。
引用
@article{arxiv.1805.09190,
title = {Towards the first adversarially robust neural network model on MNIST},
author = {Lukas Schott and Jonas Rauber and Matthias Bethge and Wieland Brendel},
journal= {arXiv preprint arXiv:1805.09190},
year = {2018}
}