面向鲁棒视觉变换器的掩码自适应集成
计算机视觉与模式识别
2024-07-23 v1 人工智能
摘要
对抗训练(AT)有助于提高视觉变换器(ViT)对对抗性攻击的鲁棒性,通过有意将对抗性样本注入训练数据。然而,这种方式的对抗注入必然会导致一定程度的标准准确率下降,从而引发标准准确率与鲁棒性之间的权衡。此外,现有的突出AT解决方案仍然容易受到自适应攻击的威胁。为解决上述问题,本文提出了一种新颖的ViT架构,包括一个探测器和一个被我们新开发的自适应集成桥接的分类器。具体而言,我们经验性地发现,探测对抗性样本的能力可从引导式反向传播技术中获益。基于这一发现,我们引入了一种新的多头自注意力 (MSA) 机制,以增强探测器以识别对抗性样本。随后,采用两个编码器的分类器用于分别提取干净图像和对抗性样本的视觉表征,并通过我们的自适应集成来灵活调整两种编码器表征的比例,以实现准确分类。该设计使我们的ViT架构能够在标准准确率和鲁棒性之间实现更好的权衡。此外,我们的自适应集成技术允许我们在输入数据中随机屏蔽一部分图像块,从而提升ViT对自适应攻击的鲁棒性,同时保持高水平的标准准确率。实验结果表明,我们的ViT架构在CIFAR-10上实现了最高的标准准确率和对抗鲁棒性,分别为90.3%和49.8%。
引用
@article{arxiv.2407.15385,
title = {Towards Robust Vision Transformer via Masked Adaptive Ensemble},
author = {Fudong Lin and Jiadong Lou and Xu Yuan and Nian-Feng Tzeng},
journal= {arXiv preprint arXiv:2407.15385},
year = {2024}
}
备注
9 pages