Visformer:对视觉友好的Transformer
计算机视觉与模式识别
2021-12-21 v5
摘要
过去一年见证了将Transformer模块应用于视觉问题的快速发展。尽管一些研究者已证明基于Transformer的模型具有良好的数据拟合能力,但仍有越来越多的证据表明这些模型存在过拟合问题,尤其是在训练数据有限时。本文通过逐步操作将基于Transformer的模型逐渐过渡为基于卷积的模型,给出了一个实证研究。我们在过渡过程中获得的结果为改进视觉识别提供了有用信息。基于这些观察,我们提出了一种名为Visformer的新架构,其缩写自“Vision-friendly Transformer(对视觉友好的Transformer)”。在相同的计算复杂度下,Visformer在ImageNet分类精度上优于基于Transformer和基于卷积的模型,且当模型复杂度更低或训练集更小时,优势更为显著。代码可在 https://github.com/danczs/Visformer 获取。
引用
@article{arxiv.2104.12533,
title = {Visformer: The Vision-friendly Transformer},
author = {Zhengsu Chen and Lingxi Xie and Jianwei Niu and Xuefeng Liu and Longhui Wei and Qi Tian},
journal= {arXiv preprint arXiv:2104.12533},
year = {2021}
}