中文

Patch-Fool:视觉Transformer是否总能鲁棒抵御对抗扰动?

计算机视觉与模式识别 2025-01-07 v3

摘要

视觉Transformer(ViTs)近期凭借其在各类视觉任务中破纪录的性能,掀起了神经架构设计的新浪潮。与此同时,为实现ViTs在真实视觉应用中的部署,其针对潜在恶意攻击的鲁棒性日益受到关注。特别地,近期工作表明相较于卷积神经网络(CNNs),ViTs对对抗攻击更具鲁棒性,并推测原因在于ViTs更关注捕获不同输入/特征块间的全局交互,从而提升了对对抗攻击所施局部扰动的鲁棒性。本工作中,我们提出一个引人深思的问题:“在何种扰动下ViTs会比CNNs更易成为脆弱的学习器?”受此驱动,我们首先开展关于ViTs与CNNs在多种现有对抗攻击下鲁棒性的综合实验,以理解其鲁棒性背后的原因。基于所得洞见,我们进而提出一个名为Patch-Fool的专用攻击框架,通过一系列注意力感知优化技术攻击自注意力机制的基本组件(即单个块)来愚弄该机制。有趣的是,我们的Patch-Fool框架首次表明ViTs未必比CNNs更能抵御对抗扰动。具体而言,我们发现相较于我们的Patch-Fool攻击,ViTs是比CNNs更脆弱的学习器,该现象在大量实验中一致成立;且来自Patch-Fool的两个变体Sparse/Mild Patch-Fool的观察揭示了一个有趣洞见:每个块上的扰动密度与强度似乎是影响ViTs与CNNs间鲁棒性排序的关键因素。

关键词

引用

@article{arxiv.2203.08392,
  title  = {Patch-Fool: Are Vision Transformers Always Robust Against Adversarial Perturbations?},
  author = {Yonggan Fu and Shunyao Zhang and Shang Wu and Cheng Wan and Yingyan Celine Lin},
  journal= {arXiv preprint arXiv:2203.08392},
  year   = {2025}
}

备注

Accepted at ICLR 2022