中文

视觉 Transformer 如何工作?

计算机视觉与模式识别 2022-06-09 v4 机器学习

摘要

多头自注意力(MSA)在计算机视觉上的成功如今无可争议。然而,人们对 MSA 如何工作知之甚少。我们给出基础性解释以帮助更好地理解 MSA 的本质。特别地,我们展示了 MSA 与视觉 Transformer(ViT)的如下性质:(1) MSA 不仅通过 flatten 损失景观提升准确率,还提升泛化能力。此种提升主要归因于其数据特异性,而非长程依赖。另一方面,ViT 受非凸损失困扰。大数据集与损失景观平滑方法缓解该问题;(2) MSA 与卷积(Conv)表现出相反行为。例如,MSA 是低通滤波器,而 Conv 是高通滤波器。因此,MSA 与 Conv 互补;(3) 多阶段神经网络表现得像小型独立模型的串联。此外,阶段末的 MSA 在预测中起关键作用。基于这些洞见,我们提出 AlterNet,一种将阶段末 Conv 块替换为 MSA 块的模型。AlterNet 不仅在大数据体制下,也在小数据体制下优于 CNN。代码见 https://github.com/xxxnell/how-do-vits-work。

关键词

引用

@article{arxiv.2202.06709,
  title  = {How Do Vision Transformers Work?},
  author = {Namuk Park and Songkuk Kim},
  journal= {arXiv preprint arXiv:2202.06709},
  year   = {2022}
}

备注

ICLR 2022 (Spotlight)