中文

通过柯西问题理解视觉Transformer的对抗鲁棒性

计算机视觉与模式识别 2022-08-02 v1 机器学习

摘要

近期关于深度学习鲁棒性的研究表明,在某些扰动(如自然损坏、对抗攻击等)下,视觉Transformer(ViTs)优于卷积神经网络(CNNs)。一些论文认为ViT优越的鲁棒性源于其对输入图像的分割;另一些则指出多头自注意力(MSA)是保持鲁棒性的关键。本文旨在引入一个原则性且统一的理论框架来研究关于ViT鲁棒性的此类论点。我们首先从理论证明,与自然语言处理中的Transformer不同,ViTs是Lipschitz连续的。随后我们从柯西问题的视角对ViTs的对抗鲁棒性进行理论分析,借此可量化鲁棒性如何逐层传播。我们证明首层与末层是影响ViTs鲁棒性的关键因素。此外,基于我们的理论,我们通过实验表明,与已有研究的论断相反,MSA仅在弱对抗攻击(如FGSM)下有助于ViTs的对抗鲁棒性,而令人惊讶的是,在更强攻击(如PGD攻击)下MSA实际上削弱了模型的对抗鲁棒性。

关键词

引用

@article{arxiv.2208.00906,
  title  = {Understanding Adversarial Robustness of Vision Transformers via Cauchy Problem},
  author = {Zheng Wang and Wenjie Ruan},
  journal= {arXiv preprint arXiv:2208.00906},
  year   = {2022}
}

备注

Accepted by ECML-PKDD 2022