通过测试时频域提示提升掩码自编码器的对抗鲁棒性
计算机视觉与模式识别
2023-08-23 v2
摘要
在本文中,我们研究了配备 BERT 预训练(例如 BEiT、MAE)的视觉变换器的对抗鲁棒性。一个令人惊讶的观察是,MAE 的对抗鲁棒性明显差于其他 BERT 预训练方法。这一观察促使我们重新思考这些 BERT 预训练方法之间的基本差异,以及这些差异如何影响针对对抗扰动的鲁棒性。我们的实证分析表明,BERT 预训练的对抗鲁棒性与重建目标高度相关,即预测掩码图像块的原始像素比预测语义上下文会更削弱模型的对抗鲁棒性,因为它引导模型更关注图像的中高频分量。基于我们的分析,我们提供了一种简单而有效的方法来提升 MAE 的对抗鲁棒性。基本思想是利用从数据集中提取的领域知识占据图像的中高频,从而缩小对抗扰动的优化空间。具体而言,我们对预训练数据的分布进行分组,并在频域上优化一组簇特定的视觉提示。在测试期间,这些提示通过基于原型的提示选择机制与输入图像结合。大量评估表明,我们的方法在保持 MAE 于 ImageNet-1k 分类上的干净性能的同时,明显提升了其对抗鲁棒性。我们的代码可在 https://github.com/shikiw/RobustMAE 获取。
引用
@article{arxiv.2308.10315,
title = {Improving Adversarial Robustness of Masked Autoencoders via Test-time Frequency-domain Prompting},
author = {Qidong Huang and Xiaoyi Dong and Dongdong Chen and Yinpeng Chen and Lu Yuan and Gang Hua and Weiming Zhang and Nenghai Yu},
journal= {arXiv preprint arXiv:2308.10315},
year = {2023}
}
备注
Accepted at ICCV 2023