中文

EfficientViT:具有级联分组注意力的内存高效视觉 transformer

计算机视觉与模式识别 2023-05-12 v1

摘要

视觉 transformer 因其高模型能力而取得了巨大成功。然而,其卓越性能伴随着沉重的计算成本,使其不适用于实时应用。在本文中,我们提出一系列名为 EfficientViT 的高速视觉 transformer。我们发现现有 transformer 模型的速度通常受内存低效操作限制,尤其是 MHSA 中的张量重塑与逐元素函数。因此,我们设计了一种具有三明治布局的新构建块,即在高效的 FFN 层之间使用单个内存受限的 MHSA,从而在提升通道通信的同时改善内存效率。此外,我们发现不同注意力头之间的注意力图具有高度相似性,导致计算冗余。为此,我们提出一种级联分组注意力模块,以完整特征的不同划分馈送注意力头,不仅节省计算成本,还提升了注意力多样性。综合实验表明 EfficientViT 优于现有高效模型,在速度与精度间取得了良好权衡。例如,我们的 EfficientViT-M5 在精度上超越 MobileNetV3-Large 达 1.9%,同时在 Nvidia V100 GPU 与 Intel Xeon CPU 上分别获得高 40.4% 与 45.2% 的吞吐量。相较于近期的高效模型 MobileViT-XXS,EfficientViT-M2 实现了 1.8% 的精度优势,同时在 GPU/CPU 上快 5.8 倍/3.7 倍,转换为 ONNX 格式后快 7.4 倍。代码与模型见 https://github.com/microsoft/Cream/tree/main/EfficientViT。

关键词

引用

@article{arxiv.2305.07027,
  title  = {EfficientViT: Memory Efficient Vision Transformer with Cascaded Group Attention},
  author = {Xinyu Liu and Houwen Peng and Ningxin Zheng and Yuqing Yang and Han Hu and Yixuan Yuan},
  journal= {arXiv preprint arXiv:2305.07027},
  year   = {2023}
}

备注

CVPR 2023