中文

局部性引导用于提升视觉Transformer在小型数据集上的性能

计算机视觉与模式识别 2022-07-21 v1

摘要

尽管视觉Transformer(VT)架构在计算机视觉中日益流行,但纯VT模型在小型数据集上表现不佳。为解决此问题,本文提出局部性引导以提升VT在小型数据集上的性能。我们首先分析指出,由于VT中自注意力机制的高度灵活性与内在全局性,对于理解图像至关重要的局部信息难以通过有限数据学习到。为促进局部信息,受CNN内置的从局部到全局的层次结构启发,我们通过模仿已训练卷积神经网络(CNN)的特征来实现对VT的局部性引导。在我们的双任务学习范式下,由低分辨率图像上训练的轻量CNN所提供的局部性引导足以大幅加速VT的收敛并提升其性能。因此,我们的局部性引导方法非常简单高效,可作为VT在小型数据集上的基础性能增强方法。大量实验表明,我们的方法在小型数据集上从头训练时能显著改善VT,并且兼容多种VT与数据集。例如,我们提出的方法在小型数据集上可提升多种VT的性能(如DeiT提升13.07%、T2T提升8.98%、PVT提升7.85%),并将更强的基线PVTv2提升1.86%至79.30%,展示了VT在小型数据集上的潜力。代码见 https://github.com/lkhl/tiny-transformers。

关键词

引用

@article{arxiv.2207.10026,
  title  = {Locality Guidance for Improving Vision Transformers on Tiny Datasets},
  author = {Kehan Li and Runyi Yu and Zhennan Wang and Li Yuan and Guoli Song and Jie Chen},
  journal= {arXiv preprint arXiv:2207.10026},
  year   = {2022}
}