中文

视觉 Transformer 对图像块扰动的鲁棒性研究

计算机视觉与模式识别 2022-07-19 v2 图像与视频处理

摘要

视觉 Transformer(ViT)的最新进展已展示其在图像分类中的优异性能,这使其成为卷积神经网络(CNN)的一种有前景的替代方案。与 CNN 不同,ViT 将输入图像表示为图像块序列。这种基于图像块的输入表示引出了一个有趣的问题:与 CNN 相比,当单个输入图像块受到自然损坏或对抗扰动时,ViT 的表现如何?本工作中,我们研究 ViT 对逐块扰动的鲁棒性。令人惊讶的是,我们发现 ViT 对自然损坏图像块比 CNN 更鲁棒,而对对抗图像块更为脆弱。此外,我们发现注意力机制极大影响了视觉 Transformer 的鲁棒性。具体而言,注意力模块可通过有效忽略自然损坏的图像块来帮助提升 ViT 的鲁棒性。然而,当 ViT 受到对抗攻击时,注意力机制很容易被欺骗,将更多关注集中于对抗扰动的图像块并导致错误。基于我们的分析,我们提出一种简单的基于温度缩放的方法,以提升 ViT 对抗对抗图像块的鲁棒性。我们进行了大量定性与定量实验,以支撑关于 ViT 对逐块扰动鲁棒性的发现、理解及改进,实验涵盖一系列基于 Transformer 的架构。

关键词

引用

@article{arxiv.2111.10659,
  title  = {Are Vision Transformers Robust to Patch Perturbations?},
  author = {Jindong Gu and Volker Tresp and Yao Qin},
  journal= {arXiv preprint arXiv:2111.10659},
  year   = {2022}
}