中文

MSG-Transformer:通过操控信使令牌交换局部空间信息

计算机视觉与模式识别 2022-03-28 v3 机器学习

摘要

Transformer 为设计用于视觉识别的神经网络提供了新方法。与卷积网络相比,Transformer 享有在每个阶段引用全局特征的能力,但注意力模块带来了更高的计算开销,阻碍了 Transformer 应用于处理高分辨率视觉数据。本文旨在缓解效率与灵活性之间的冲突,为此我们为每个区域提出一个专用令牌作为信使(MSG)。因此,通过操控这些 MSG 令牌,可以灵活地在区域间交换视觉信息并降低计算复杂度。随后我们将 MSG 令牌整合进一个名为 MSG-Transformer 的多尺度架构中。在标准图像分类和目标检测中,MSG-Transformer 取得了有竞争力的性能,且在 GPU 和 CPU 上的推理均被加速。代码见 https://github.com/hustvl/MSG-Transformer。

关键词

引用

@article{arxiv.2105.15168,
  title  = {MSG-Transformer: Exchanging Local Spatial Information by Manipulating Messenger Tokens},
  author = {Jiemin Fang and Lingxi Xie and Xinggang Wang and Xiaopeng Zhang and Wenyu Liu and Qi Tian},
  journal= {arXiv preprint arXiv:2105.15168},
  year   = {2022}
}

备注

Accepted by CVPR 2022