中文

LeViT:披着卷积网络外衣以实现更快推理的视觉 Transformer

计算机视觉与模式识别 2021-05-07 v2

摘要

我们设计了一系列图像分类架构,在高速场景下优化准确率与效率之间的权衡。我们的工作利用了近期基于注意力架构的发现,这些架构在高度并行处理的硬件上具有竞争力。我们重新审视了关于卷积神经网络的丰富文献中的原则,将其应用于 transformer,特别是分辨率递减的激活图。我们还引入了注意力偏置(attention bias),一种在视觉 transformer 中整合位置信息的新方法。由此,我们提出了 LeViT:一种用于快速推理图像分类的混合神经网络。我们考虑了不同硬件平台上的不同效率度量,以最好地反映广泛的应用场景。我们大量的实验从经验上验证了我们的技术选择,并表明它们适用于大多数架构。总体而言,在速度/准确率权衡方面,LeViT 显著优于现有的卷积网络和视觉 transformer。例如,在 80% ImageNet top-1 准确率下,LeViT 在 CPU 上比 EfficientNet 快 5 倍。我们在 https://github.com/facebookresearch/LeViT 发布了代码。

关键词

引用

@article{arxiv.2104.01136,
  title  = {LeViT: a Vision Transformer in ConvNet's Clothing for Faster Inference},
  author = {Ben Graham and Alaaeldin El-Nouby and Hugo Touvron and Pierre Stock and Armand Joulin and Hervé Jégou and Matthijs Douze},
  journal= {arXiv preprint arXiv:2104.01136},
  year   = {2021}
}