中文

揭示视觉变换器对对抗攻击的鲁棒性

计算机视觉与模式识别 2021-09-21 v2

摘要

原始视觉变换器(ViT)的主要组成部分是注意力模块,其赋予了模仿输入图像全局上下文的能力。为获得更好性能,ViT 需要大规模训练数据。为克服这一数据饥渴限制,许多基于 ViT 的网络或混合 ViT(hybrid-ViT)被提出以在训练中引入局部上下文。与 CNN 不同,ViT 及其变体对对抗攻击的鲁棒性在文献中尚未被广泛研究。本工作研究了 ViT 变体的鲁棒性:1)与 CNN 相比,针对不同基于 Lp 的对抗攻击的鲁棒性;2)在应用预处理防御方法后的对抗样本(AEs)下的鲁棒性;3)在使用期望变换(EOT)框架的自适应攻击下的鲁棒性。为此,我们在来自 ImageNet-1k 的 1000 张图像上运行了一系列实验,随后提供的分析表明,原始 ViT 或混合 ViT 比 CNN 更具鲁棒性。例如,我们发现:1)在基于 Lp 的攻击和自适应攻击下,原始 ViT 或混合 ViT 比 CNN 更鲁棒;2)与混合 ViT 不同,原始 ViT 对主要削弱高频分量的预处理防御无响应。此外,为深入理解基于注意力的模型,提供了特征图、注意力图和 Grad-CAM 可视化,并结合图像质量度量和扰动能量谱进行分析。

关键词

引用

@article{arxiv.2106.03734,
  title  = {Reveal of Vision Transformers Robustness against Adversarial Attacks},
  author = {Ahmed Aldahdooh and Wassim Hamidouche and Olivier Deforges},
  journal= {arXiv preprint arXiv:2106.03734},
  year   = {2021}
}