中文

Visformer:对视觉友好的Transformer

计算机视觉与模式识别 2021-12-21 v5

摘要

过去一年见证了将Transformer模块应用于视觉问题的快速发展。尽管一些研究者已证明基于Transformer的模型具有良好的数据拟合能力,但仍有越来越多的证据表明这些模型存在过拟合问题,尤其是在训练数据有限时。本文通过逐步操作将基于Transformer的模型逐渐过渡为基于卷积的模型,给出了一个实证研究。我们在过渡过程中获得的结果为改进视觉识别提供了有用信息。基于这些观察,我们提出了一种名为Visformer的新架构,其缩写自“Vision-friendly Transformer(对视觉友好的Transformer)”。在相同的计算复杂度下,Visformer在ImageNet分类精度上优于基于Transformer和基于卷积的模型,且当模型复杂度更低或训练集更小时,优势更为显著。代码可在 https://github.com/danczs/Visformer 获取。

关键词

引用

@article{arxiv.2104.12533,
  title  = {Visformer: The Vision-friendly Transformer},
  author = {Zhengsu Chen and Lingxi Xie and Jianwei Niu and Xuefeng Liu and Longhui Wei and Qi Tian},
  journal= {arXiv preprint arXiv:2104.12533},
  year   = {2021}
}