中文

通过前向传播精炼提升视觉Transformer的对抗迁移性

计算机视觉与模式识别 2025-03-20 v1 密码学与安全

摘要

视觉Transformer(ViT)已被广泛应用于各种计算机视觉和视觉语言任务。为了深入了解其在实际场景中的鲁棒性,ViT 上的可迁移对抗样本已得到广泛研究。提升对抗迁移性的典型方法是通过精炼替代模型。然而,现有针对 ViT 的工作将替代模型精炼限制在反向传播中。在本工作中,我们转而关注前向传播精炼(FPR),并具体精炼 ViT 的两个关键模块:注意力图和令牌嵌入。对于注意力图,我们提出了注意力图多样化(AMD),它对某些注意力图进行多样化,并在反向传播中隐式施加有益的梯度消失。对于令牌嵌入,我们提出了动量令牌嵌入(MTE),它累积历史令牌嵌入以稳定注意力块和 MLP 块中的前向更新。我们进行了大量实验,将从 ViT 转移到各种 CNN 和 ViT 的对抗样本进行了测试,结果表明我们的 FPR 平均优于当前最佳(反向)替代模型精炼方法高达 7.0%。我们还验证了其相对于流行防御方法的优越性以及与其他迁移方法的兼容性。代码和附录可在 https://github.com/RYC-98/FPR 获取。

关键词

引用

@article{arxiv.2503.15404,
  title  = {Improving Adversarial Transferability on Vision Transformers via Forward Propagation Refinement},
  author = {Yuchen Ren and Zhengyu Zhao and Chenhao Lin and Bo Yang and Lu Zhou and Zhe Liu and Chao Shen},
  journal= {arXiv preprint arXiv:2503.15404},
  year   = {2025}
}

备注

CVPR2025