中文

面向小尺寸数据集的视觉 Transformer

计算机视觉与模式识别 2021-12-28 v1

摘要

近来,将 transformer 结构应用于图像分类任务的 Vision Transformer(ViT)已超越卷积神经网络。然而,ViT 的高性能来源于使用如 JFT-300M 等大型数据集的预训练,其对大型数据集的依赖性被解释为源于较低的局部性归纳偏置。本文提出移位块词元化(Shifted Patch Tokenization, SPT)与局部性自注意力(Locality Self-Attention, LSA),其有效解决了局部性归纳偏置的缺乏,并使其即使在小尺寸数据集上也能从零开始学习。此外,SPT 与 LSA 是通用且有效的附加模块,易于应用于各种 ViT。实验结果表明,当将 SPT 与 LSA 同时应用于 ViT 时,在代表性小尺寸数据集 Tiny-ImageNet 上性能平均提升 2.96%。特别是,Swin Transformer 借助所提出的 SPT 与 LSA 实现了 4.08% 的压倒性性能提升。

关键词

引用

@article{arxiv.2112.13492,
  title  = {Vision Transformer for Small-Size Datasets},
  author = {Seung Hoon Lee and Seunghyun Lee and Byung Cheol Song},
  journal= {arXiv preprint arXiv:2112.13492},
  year   = {2021}
}