中文

发掘 ViTs 计算冗余以提升对抗性迁移性

计算机视觉与模式识别 2025-11-18 v3

摘要

Vision Transformer (ViT) 在众多应用场景中展现出卓越的性能,包括许多安全关键任务。然而,其独特的架构特性在对抗鲁棒性方面带来了新的挑战与机遇。特别是,我们观察到在 ViT 上 crafting 的对抗样本相较于 CNN 的对抗样本具有更高的迁移性,表明 ViT 包含有利于可 transfer 攻击的结构特性。本文探讨了计算冗余在 ViT 中的作用及其对对抗性迁移性的影响。与旨在降低计算效率的先前研究不同,我们提出利用这种冗余来提高对抗样本的质量和迁移性。通过详细分析,我们识别出两种形式的冗余,包括数据层级和模型层级,可被加以利用以放大攻击效果。基于这些洞见,我们设计了一套技术措施,包括注意力稀疏性操作、注意力头置换、干净 token 正则化、ghost MoE 多样化以及测试时对抗训练。在 ImageNet-1k 数据集上的大量实验验证了我们方法的有效性,显示我们的方法在各种模型架构上的 transferability 和 generality 均显著优于现有基线。

关键词

引用

@article{arxiv.2504.10804,
  title  = {Harnessing the Computation Redundancy in ViTs to Boost Adversarial Transferability},
  author = {Jiani Liu and Zhiyuan Wang and Zeliang Zhang and Chao Huang and Susan Liang and Yunlong Tang and Chenliang Xu},
  journal= {arXiv preprint arXiv:2504.10804},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025