ViT-P:从局部性视角重新思考数据高效视觉Transformer
计算机视觉与模式识别
2022-03-07 v1
摘要
Transformer的最新进展为计算机视觉任务带来了新的信心。然而,在小数据集上,Transformer难以训练且性能低于卷积神经网络。我们通过引入多焦点注意力偏置,使视觉Transformer在数据效率上媲美卷积神经网络。受训练良好的ViT中注意力距离的启发,我们约束ViT的自注意力具有多尺度局部化感受野。感受野的大小在训练过程中可自适应调整,从而学习到最优配置。我们提供了经验证据,表明对感受野的适当约束可减少视觉Transformer所需的训练数据量。在Cifar100上,我们的ViT-P Base模型从零开始训练即达到了最先进的准确率(83.16%)。我们还在ImageNet上进行分析,表明我们的方法在大型数据集上不会损失准确率。
引用
@article{arxiv.2203.02358,
title = {ViT-P: Rethinking Data-efficient Vision Transformers from Locality},
author = {Bin Chen and Ran Wang and Di Ming and Xin Feng},
journal= {arXiv preprint arXiv:2203.02358},
year = {2022}
}