分类器对对抗扰动的鲁棒性分析
机器学习
2016-03-30 v4 计算机视觉与模式识别
机器学习
摘要
本文旨在分析深度网络中最近发现的一个有趣现象,即其对对抗扰动的不稳定性(Szegedy et. al., 2014)。我们提供了分析分类器对对抗扰动鲁棒性的理论框架,并给出了分类器鲁棒性的基本上限。具体而言,我们建立了分类器对对抗扰动鲁棒性的一般上界,然后在线性和二次分类器族上阐释了该上界。在这两种情况下,我们的上界依赖于一个捕捉分类任务难度概念的可区分性度量。我们对这两类分类器的结果意味着,在涉及小可区分性的任务中,即使取得了良好的准确率,所考虑集合中的任何分类器都不会对对抗扰动鲁棒。我们的理论框架进一步表明,对抗不稳定性现象是由于分类器的低灵活性,相较于分类任务的难度(由可区分性捕捉)。此外,我们展示了分类器对随机噪声的鲁棒性与其对对抗扰动的鲁棒性之间存在明显区别。具体而言,对于线性分类器,前者被证明比后者大一个与\sqrt{d}成正比的因子(d为信号维度)。该结果从理论上解释了高维问题中两种鲁棒性之间的差距,这一差距在神经网络背景下已被经验观察到。据我们所知,我们的结果提供了首个探讨深度网络最近观察到的对抗不稳定性现象的理论工作。我们的分析辅以在受控和真实世界数据上的实验结果。
引用
@article{arxiv.1502.02590,
title = {Analysis of classifiers' robustness to adversarial perturbations},
author = {Alhussein Fawzi and Omar Fawzi and Pascal Frossard},
journal= {arXiv preprint arXiv:1502.02590},
year = {2016}
}