中文

Vision Xformers:面向图像分类的高效注意力

计算机视觉与模式识别 2021-10-04 v4 人工智能 计算复杂性 机器学习

摘要

尽管 transformer 已成为自然语言处理中首选的神经网络架构,但要与计算机视觉中的卷积神经网络竞争,它们需要数量级更多的训练数据、GPU 内存和计算量。transformer 的注意力机制随输入序列长度呈二次方扩展,而展开后的图像具有很长的序列长度。此外,transformer 缺乏适用于图像的归纳偏置。我们测试了三种针对视觉 transformer(ViT)架构的改进以解决这些缺陷。首先,我们通过使用称为 X-formers 的线性注意力机制(其中 X ∈ {Performer, Linformer, Nystr"omformer})来缓解二次瓶颈,从而创建 Vision X-formers(ViXs)。这使 GPU 内存需求最多减少七倍。我们还将它们的性能与 FNet 和多层感知机混合器进行比较,后者进一步降低了 GPU 内存需求。其次,我们在 ViX 中用卷积层替换初始线性嵌入层,引入图像的归纳偏置,这在不增大模型尺寸的情况下显著提高了分类准确率。第三,我们将 ViT 中可学习的 1D 位置嵌入替换为旋转位置嵌入(RoPE),在相同模型尺寸下提高了分类准确率。我们相信,引入此类改动可通过使 transformer 惠及数据和计算资源有限的研究者而实现其普及。

关键词

引用

@article{arxiv.2107.02239,
  title  = {Vision Xformers: Efficient Attention for Image Classification},
  author = {Pranav Jeevan and Amit Sethi},
  journal= {arXiv preprint arXiv:2107.02239},
  year   = {2021}
}

备注

11 pages, 4 figures