中文

具有局部性归纳偏置与特征归一化的鲁棒Transformer

计算机视觉与模式识别 2023-01-30 v1

摘要

视觉Transformer已证明可使用基于注意力的网络在多种计算机视觉任务上取得最先进的结果。然而,Transformer的研究工作大多未探讨鲁棒性/准确率权衡,且仍难以应对对抗扰动。本文探究视觉Transformer对抗扰动的鲁棒性,并尝试在白盒攻击设定下提升其鲁棒性/准确率权衡。为此,我们提出局部中的局部(LNL)Transformer模型。我们证明向LNL引入局部性有助于鲁棒性表现,因其聚合了线条、边缘、形状乃至物体等局部信息。此外,为进一步提升鲁棒性表现,我们鼓励LNL从矩(即均值与标准差)及归一化特征中提取训练信号。我们在德国交通标志识别基准(GTSRB)与加拿大高等研究院(CIFAR-10)上以准确率和鲁棒性指标取得最先进结果,从而验证了LNL的有效性与通用性。更具体地,对于交通标志分类,所提LNL相较最先进研究在干净准确率与鲁棒准确率上分别带来1.1%和约35%的提升。

关键词

引用

@article{arxiv.2301.11553,
  title  = {Robust Transformer with Locality Inductive Bias and Feature Normalization},
  author = {Omid Nejati Manzari and Hossein Kashiani and Hojat Asgarian Dehkordi and Shahriar Baradaran Shokouhi},
  journal= {arXiv preprint arXiv:2301.11553},
  year   = {2023}
}

备注

9 pages, 3 Figures, 6 Tables