中文

SP-ViT:为视觉Transformer学习二维空间先验

计算机视觉与模式识别 2022-06-16 v1

摘要

近来,Transformer在图像分类中展现出巨大潜力,并在ImageNet基准上确立了最先进的结果。然而,与CNN相比,由于缺乏空间归纳偏置,Transformer收敛缓慢且在小数据情形下易于过拟合。此类空间归纳偏置可能尤其有益,因为输入图像的二维结构在Transformer中未能得到良好保持。本工作中,我们提出空间先验增强自注意力(SP-SA),这是为标准自注意力(SA)量身定制的一种新颖变体,专为视觉Transformer设计。空间先验(SPs)是我们提出的一类归纳偏置,用于突出某些组的空间关系。与被迫仅关注硬编码局部区域的卷积归纳偏置不同,我们提出的SP由模型自身学习,并考虑多种空间关系。具体而言,注意力分数在每个头的计算中强调某些类型的空间关系,且此类学到的空间焦点可互为补充。基于SP-SA,我们提出SP-ViT系列,其以相近的GFlops或参数量持续优于其他ViT模型。我们最大的模型SP-ViT-L取得了破纪录的86.3% Top-1准确率,且在所有于224x224上训练并在384x384分辨率下微调、无额外数据的ImageNet-1K模型中,与先前最先进模型相比参数量减少近50%(SP-ViT-L为150M,而CaiT-M-36为271M)。

关键词

引用

@article{arxiv.2206.07662,
  title  = {SP-ViT: Learning 2D Spatial Priors for Vision Transformers},
  author = {Yuxuan Zhou and Wangmeng Xiang and Chao Li and Biao Wang and Xihan Wei and Lei Zhang and Margret Keuper and Xiansheng Hua},
  journal= {arXiv preprint arXiv:2206.07662},
  year   = {2022}
}