中文

面向视觉变换器的查询高效硬标签黑盒攻击

计算机视觉与模式识别 2024-07-02 v1

摘要

最近的研究表明,视觉变换器(ViTs)面临来自对抗攻击的类似风险,这些风险与深度卷积神经网络(CNNs)类似。然而,直接将针对CNNs的攻击方法应用于ViTs已被证明无效,因为ViTs通常基于 patch 级编码工作。本文探讨了ViTs在黑盒场景下针对对抗攻击的脆弱性,提出一种 novel query 高效硬标签对抗攻击方法称为 AdvViT。具体而言,考虑到ViTs对 patch 修改高度敏感,我们提出在单个 patch 上优化对抗扰动。为降低扰动搜索空间的维度,我们仅修改每个 patch 的少数低频分量。此外,我们设计了一个针对整个图像不同区域的 all patches 的权重掩码矩阵,以进一步优化扰动。我们在 ImageNet-1k 数据集上测试了六个主流的 ViT 骨干网络。实验结果表明,与针对CNNs的最新攻击方法相比,在相同的查询预算下,我们的 AdvViT 在 L2-范数扰动上实现了更低的误差,充分验证了ViTs面临对抗攻击的脆弱性。

关键词

引用

@article{arxiv.2407.00389,
  title  = {Query-Efficient Hard-Label Black-Box Attack against Vision Transformers},
  author = {Chao Zhou and Xiaowen Shi and Yuan-Gen Wang},
  journal= {arXiv preprint arXiv:2407.00389},
  year   = {2024}
}