中文

面向视觉Transformer的可迁移对抗攻击研究

计算机视觉与模式识别 2022-01-04 v3 人工智能

摘要

视觉Transformer(ViTs)在一系列计算机视觉任务中展现了令人印象深刻的性能,但它们仍然受到对抗样本的影响。在本文中,我们提出,针对Transformer的对抗攻击应专门为其架构量身定制,同时考虑图像块和自注意力机制,以实现高迁移性。更具体地说,我们引入了一个双重攻击框架,包含一种“忽略注意力”(Pay No Attention, PNA)攻击和一种PatchOut攻击,以提高对抗样本在不同ViT之间的迁移性。我们表明,在反向传播过程中跳过注意力的梯度可以生成具有高迁移性的对抗样本。此外,通过在每次迭代中优化随机采样的图像块子集生成的对抗扰动,比使用所有图像块的攻击获得了更高的攻击成功率。我们在最先进的ViT、CNN和经过鲁棒训练的CNN上评估了攻击的迁移性。这些实验结果表明,所提出的双重攻击可以极大地提升ViT之间以及从ViT到CNN的迁移性。此外,所提出的方法可以轻松地与现有的迁移方法结合以提升性能。代码可在 https://github.com/zhipeng-wei/PNA-PatchOut 获取。

关键词

引用

@article{arxiv.2109.04176,
  title  = {Towards Transferable Adversarial Attacks on Vision Transformers},
  author = {Zhipeng Wei and Jingjing Chen and Micah Goldblum and Zuxuan Wu and Tom Goldstein and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2109.04176},
  year   = {2022}
}