中文

ViTGuard:基于注意力机制的Vision Transformer对抗样本检测方法

计算机视觉与模式识别 2024-09-24 v1 密码学与安全

摘要

Transformer技术在视觉任务中的应用已挑战了卷积神经网络(CNN)在计算机视觉中的传统主导地位。在图像分类任务中,Vision Transformer (ViT)能够有效地在图像中的patch之间建立空间关系,引导注意力聚焦于重要区域以实现准确预测。然而,类似于CNN,ViT也容易受到对抗攻击的威胁,这些攻击会在精心设计的扰动下误导图像分类器作出错误决策。此外,针对ViT的对抗补丁攻击会引入小范围内的任意扰动,这种威胁尤为严重。更糟糕的是,传统检测方法原本为CNN模型设计,在应用于ViT时往往不可行或性能显著下降,并且通常忽视了补丁攻击。本文提出ViTGuard作为一种通用的ViT模型对抗攻击检测方法,包括覆盖整个输入的典型攻击和补丁攻击。ViTGuard使用掩码自编码器(MAE)模型从未遮蔽区域恢复随机遮蔽的patch,提供灵活的图像重建策略。随后,基于阈值的检测器利用ViT特征,包括注意力图和分类(CLS)标记表示,来区分正常样本和对抗样本。MAE模型在训练时不涉及任何对抗样本,确保了对未知攻击的检测效果。我们将ViTGuard与七种现有检测方法在九种攻击下的三个数据集上进行比较。评估结果表明,ViTGuard在现有检测器之上占据优势。最后,考虑到潜在的检测规避,我们进一步展示了ViTGuard在针对规避的自适应攻击下的鲁棒性。

关键词

引用

@article{arxiv.2409.13828,
  title  = {ViTGuard: Attention-aware Detection against Adversarial Examples for Vision Transformer},
  author = {Shihua Sun and Kenechukwu Nwodo and Shridatt Sugrim and Angelos Stavrou and Haining Wang},
  journal= {arXiv preprint arXiv:2409.13828},
  year   = {2024}
}

备注

To appear in the Annual Computer Security Applications Conference (ACSAC) 2024