Vision Transformer与MLP-Mixer相对于CNN的对抗鲁棒性比较
计算机视觉与模式识别
2021-10-12 v2 密码学与安全
机器学习
摘要
近年来,卷积神经网络(CNNs)已成为计算机视觉应用中事实上的黄金标准。然而,最近提出了挑战现状的新模型架构。Vision Transformer(ViT)仅依赖注意力模块,而MLP-Mixer架构用多层感知机(MLPs)替代了自注意力模块。尽管取得了巨大成功,但众所周知CNNs易受对抗攻击,这对安全敏感应用引起了严重担忧。因此,社区亟需了解新提出的ViT和MLP-Mixer是否也易受对抗攻击。为此,我们在多种对抗攻击设置下实证评估了它们的对抗鲁棒性,并与广泛使用的CNNs进行了基准比较。总体而言,我们发现这两种架构(尤其是ViT)比其CNN模型更鲁棒。通过一个玩具示例,我们还提供了实证证据,表明CNNs较低的对抗鲁棒性可部分归因于其平移不变性。我们的频率分析表明,最鲁棒的ViT架构相比CNNs更倾向于依赖低频特征。此外,我们有一个有趣的发现:MLP-Mixer对通用对抗扰动极其脆弱。
引用
@article{arxiv.2110.02797,
title = {Adversarial Robustness Comparison of Vision Transformer and MLP-Mixer to CNNs},
author = {Philipp Benz and Soomin Ham and Chaoning Zhang and Adil Karjauv and In So Kweon},
journal= {arXiv preprint arXiv:2110.02797},
year = {2021}
}
备注
Code: https://github.com/phibenz/robustness_comparison_vit_mlp-mixer_cnn