面向小尺寸数据集的视觉 Transformer
计算机视觉与模式识别
2021-12-28 v1
摘要
近来,将 transformer 结构应用于图像分类任务的 Vision Transformer(ViT)已超越卷积神经网络。然而,ViT 的高性能来源于使用如 JFT-300M 等大型数据集的预训练,其对大型数据集的依赖性被解释为源于较低的局部性归纳偏置。本文提出移位块词元化(Shifted Patch Tokenization, SPT)与局部性自注意力(Locality Self-Attention, LSA),其有效解决了局部性归纳偏置的缺乏,并使其即使在小尺寸数据集上也能从零开始学习。此外,SPT 与 LSA 是通用且有效的附加模块,易于应用于各种 ViT。实验结果表明,当将 SPT 与 LSA 同时应用于 ViT 时,在代表性小尺寸数据集 Tiny-ImageNet 上性能平均提升 2.96%。特别是,Swin Transformer 借助所提出的 SPT 与 LSA 实现了 4.08% 的压倒性性能提升。
引用
@article{arxiv.2112.13492,
title = {Vision Transformer for Small-Size Datasets},
author = {Seung Hoon Lee and Seunghyun Lee and Byung Cheol Song},
journal= {arXiv preprint arXiv:2112.13492},
year = {2021}
}