面向视觉的卷积 Xformer
计算机视觉与模式识别
2022-01-26 v1 人工智能
机器学习
摘要
尽管视觉 transformer(ViT)在某些基准上具有最先进的精度,但在图像处理中的实际用途有限。其用途有限的原因包括:与卷积神经网络(CNN)相比,由于其自注意力机制的二次复杂度,它们需要更大的训练数据集和更多的计算资源。我们提出一种线性注意力-卷积混合架构——面向视觉的卷积 X-former(CXV)——以克服这些限制。我们用 Performer、Nystr"omformer 和 Linear Transformer 等线性注意力机制替代二次注意力,以降低其 GPU 使用量。图像数据的归纳偏置由卷积子层提供,从而消除了 ViT 所使用的 class token 与位置嵌入的需求。我们还提出一种新的训练方法,在训练的不同阶段使用两种不同的优化器,并表明它提升了不同架构上的 top-1 图像分类精度。在数据与 GPU 资源(核心、内存、功耗)有限的场景下,CXV 在图像分类上优于其他架构、token mixer(如 ConvMixer、FNet 和 MLP Mixer)、transformer 模型(如 ViT、CCT、CvT 和混合 Xformer)以及 ResNet。
引用
@article{arxiv.2201.10271,
title = {Convolutional Xformers for Vision},
author = {Pranav Jeevan and Amit sethi},
journal= {arXiv preprint arXiv:2201.10271},
year = {2022}
}
备注
9 pages, 3 figures