重新思考视觉变换器的空间维度
计算机视觉与模式识别
2021-08-19 v2
摘要
视觉变换器(ViT)将变换器的应用范围从语言处理扩展到计算机视觉任务,作为现有卷积神经网络(CNN)的一种替代架构。由于基于变换器的架构在计算机视觉建模中具有创新性,针对有效架构的设计惯例尚少有研究。借鉴CNN的成功设计原则,我们研究了空间维度转换的作用及其在基于变换器的架构上的有效性。我们特别关注CNN的维度缩减原则:随着深度增加,传统CNN增加通道维度并减小空间维度。我们通过实验表明,这种空间维度缩减同样有益于变换器架构,并基于原始ViT模型提出了一种新颖的基于池化的视觉变换器(PiT)。我们表明,与ViT相比,PiT实现了改进的模型能力与泛化性能。通过大量实验,我们进一步表明PiT在图像分类、目标检测和鲁棒性评估等多项任务上优于基线。源代码和ImageNet模型可在 https://github.com/naver-ai/pit 获取。
引用
@article{arxiv.2103.16302,
title = {Rethinking Spatial Dimensions of Vision Transformers},
author = {Byeongho Heo and Sangdoo Yun and Dongyoon Han and Sanghyuk Chun and Junsuk Choe and Seong Joon Oh},
journal= {arXiv preprint arXiv:2103.16302},
year = {2021}
}
备注
ICCV 2021 camera-ready version