中文

基于补丁级对抗去除的针对视觉Transformer的决策型黑盒攻击

计算机视觉与模式识别 2022-09-16 v2 密码学与安全

摘要

视觉Transformer(ViTs)已展现出优于卷积神经网络(CNNs)的性能与更强的对抗鲁棒性。一方面,ViTs 关注各图像块之间的全局交互,降低了对图像的局部噪声敏感度。另一方面,现有决策型攻击忽略了图像不同区域间噪声敏感度的差异,进一步损害了噪声压缩效率,尤其对 ViTs 而言。因此,在仅能查询目标模型的情况下验证 ViTs 的黑盒对抗鲁棒性仍是一个挑战性问题。本文从图像区域间噪声敏感度差异的角度理论分析了现有决策型攻击的局限,并提出一种针对 ViTs 的新决策型黑盒攻击,称为补丁级对抗去除(PAR)。PAR 通过由粗到细的搜索过程将图像划分为块,并分别对各块上的噪声进行压缩。PAR 记录每个块的噪声幅值与噪声敏感度,并选择查询值最高的块进行噪声压缩。此外,PAR 可用作其他决策型攻击的噪声初始化方法,在不引入额外计算的情况下提升对 ViTs 与 CNNs 的噪声压缩效率。在三个数据集上的大量实验表明,PAR 在同等查询次数下实现了低得多的噪声幅值。

关键词

引用

@article{arxiv.2112.03492,
  title  = {Decision-based Black-box Attack Against Vision Transformers via Patch-wise Adversarial Removal},
  author = {Yucheng Shi and Yahong Han and Yu-an Tan and Xiaohui Kuang},
  journal= {arXiv preprint arXiv:2112.03492},
  year   = {2022}
}