中文

深度神经网络对对抗图像失去注意力

计算机视觉与模式识别 2021-06-11 v1 人工智能 机器学习

摘要

对抗算法已被证明对神经网络在多种任务上有效。一些对抗算法在图像分类任务中对图像的所有像素进行最小扰动。相比之下,一些算法对少数像素进行强扰动。然而,关于为何这些彼此差异巨大的对抗样本会存在,目前所知甚少。最近,Vargas 等人表明,这些对抗样本的存在可能是由于神经网络内部存在冲突显著性。我们通过分析原始样本与几种不同类型对抗样本的显著性图(SM)和梯度加权类激活图(Grad-CAM)来检验这一冲突显著性假设。我们还分析了不同对抗样本相较于原始样本如何扭曲神经网络的注意力。我们表明,在像素攻击(Pixel Attack)的情况下,被扰动的像素要么将网络注意力吸引到自身,要么将注意力从自身转移开。同时,投影梯度下降攻击(Projected Gradient Descent Attack)扰动像素,使得神经网络内部的中间层对正确类别失去注意力。我们还表明,两种攻击对显著性图和激活图的影响不同。从而,阐明了为何某些防御对部分攻击有效却仍对其他攻击脆弱。我们希望该分析能增进对对抗样本存在及其影响的理解,并助力学界开发更鲁棒的神经网络。

关键词

引用

@article{arxiv.2106.05657,
  title  = {Deep neural network loses attention to adversarial images},
  author = {Shashank Kotyan and Danilo Vasconcellos Vargas},
  journal= {arXiv preprint arXiv:2106.05657},
  year   = {2021}
}

备注

Accepted in Workshop on Artificial Intelligence Safety (AISafety 2021), IJCAI-2021