中文

基于梯度的对抗攻击的扰动分析

机器学习 2020-06-03 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

在发现对抗样本及其对深度学习模型的负面影响后,许多研究专注于寻找更多样的方法来生成这些精心构造的样本。尽管文献中详细讨论了对抗样本生成方法针对防御机制有效性的经验结果,但对这些对抗攻击的理论性质和扰动有效性的深入研究在很大程度上是缺乏的。在本文中,我们研究了三种流行的对抗样本生成方法的目标函数:L-BFGS 攻击、迭代快速梯度符号攻击以及 Carlini & Wagner 的攻击(CW)。具体而言,我们对上述攻击背后的损失函数进行了比较性和形式化分析,同时给出了在 ImageNet 数据集上的大规模实验结果。该分析揭示了:(1) 交叉熵损失的更快优化速度以及受限的优化空间,(2) 使用交叉熵损失的符号对优化精度以及优化空间的有害影响,以及 (3) 对数损失在对抗性背景下的缓慢优化速度。我们的实验揭示,被认为生成对抗样本快速的迭代快速梯度符号攻击,在相等扰动设定下就生成对抗样本所需迭代次数而言是最差的攻击。此外,我们的实验表明,被批评为比其他对抗攻击明显慢得多的 CW 的底层损失函数,并不比其他损失函数慢那么多。最后,我们分析了神经网络在多大程度上能够识别所考虑攻击生成的对抗扰动,并在此重新审视了在 ImageNet 上的对抗重训练思想。

关键词

引用

@article{arxiv.2006.01456,
  title  = {Perturbation Analysis of Gradient-based Adversarial Attacks},
  author = {Utku Ozbulak and Manvel Gasparyan and Wesley De Neve and Arnout Van Messem},
  journal= {arXiv preprint arXiv:2006.01456},
  year   = {2020}
}

备注

Accepted for publication in Pattern Recognition Letters, 2020