面向视觉Transformer的高效对抗训练
计算机视觉与模式识别
2022-07-22 v1
摘要
视觉Transformer(ViT)作为卷积神经网络(CNN)的有力替代,已受到广泛关注。近期工作表明ViT也像CNN一样易受对抗样本攻击。为构建鲁棒ViT,一种直观方法是应用对抗训练,因其已被证明是获得鲁棒CNN的最有效方法之一。然而,对抗训练的一个主要局限是其沉重计算成本。ViT采用的自我注意力机制是计算密集型操作,其开销随输入块数量呈二次增长,使得ViT上的对抗训练更加耗时。本工作中,我们首先在多种视觉Transformer上全面研究快速对抗训练,并阐明效率与鲁棒性之间的关系。然后,为加速ViT上的对抗训练,我们提出一种高效的注意力引导对抗训练机制。具体而言,利用自我注意力的特性,我们在对抗训练期间以注意力引导丢弃策略主动移除每层的某些块嵌入。精简后的自我注意力模块显著加速了ViT上的对抗训练。仅用快速对抗训练时间的65%,我们在具挑战性的ImageNet基准上达到了最先进结果。
引用
@article{arxiv.2207.10498,
title = {Towards Efficient Adversarial Training on Vision Transformers},
author = {Boxi Wu and Jindong Gu and Zhifeng Li and Deng Cai and Xiaofei He and Wei Liu},
journal= {arXiv preprint arXiv:2207.10498},
year = {2022}
}