Vision Xformers:面向图像分类的高效注意力
计算机视觉与模式识别
2021-10-04 v4 人工智能
计算复杂性
机器学习
摘要
尽管 transformer 已成为自然语言处理中首选的神经网络架构,但要与计算机视觉中的卷积神经网络竞争,它们需要数量级更多的训练数据、GPU 内存和计算量。transformer 的注意力机制随输入序列长度呈二次方扩展,而展开后的图像具有很长的序列长度。此外,transformer 缺乏适用于图像的归纳偏置。我们测试了三种针对视觉 transformer(ViT)架构的改进以解决这些缺陷。首先,我们通过使用称为 X-formers 的线性注意力机制(其中 X ∈ {Performer, Linformer, Nystr"omformer})来缓解二次瓶颈,从而创建 Vision X-formers(ViXs)。这使 GPU 内存需求最多减少七倍。我们还将它们的性能与 FNet 和多层感知机混合器进行比较,后者进一步降低了 GPU 内存需求。其次,我们在 ViX 中用卷积层替换初始线性嵌入层,引入图像的归纳偏置,这在不增大模型尺寸的情况下显著提高了分类准确率。第三,我们将 ViT 中可学习的 1D 位置嵌入替换为旋转位置嵌入(RoPE),在相同模型尺寸下提高了分类准确率。我们相信,引入此类改动可通过使 transformer 惠及数据和计算资源有限的研究者而实现其普及。
引用
@article{arxiv.2107.02239,
title = {Vision Xformers: Efficient Attention for Image Classification},
author = {Pranav Jeevan and Amit Sethi},
journal= {arXiv preprint arXiv:2107.02239},
year = {2021}
}
备注
11 pages, 4 figures