中文

重新思考基于 MLP 的视觉骨干网络中的令牌混合 MLP

计算机视觉与模式识别 2021-06-29 v1

摘要

在过去十年中,我们见证了机器视觉骨干网络的快速进展。通过引入来自图像处理的归纳偏置,卷积神经网络(CNN)已在众多计算机视觉任务中取得优异性能,并确立为事实上的骨干网络。近年来,受 Transformer 在 NLP 任务巨大成功的启发,视觉 Transformer 模型涌现。使用少得多的归纳偏置,它们相比 CNN 对应模型在计算机视觉任务中取得了有前景的性能。最近,研究者探索使用纯 MLP 架构构建视觉骨干网络以进一步减少归纳偏置,取得了良好性能。纯 MLP 骨干网络建立在通道混合 MLP(融合通道)和令牌混合 MLP(用于块间通信)之上。本文中,我们重新思考令牌混合 MLP 的设计。我们发现现有基于 MLP 的骨干网络中的令牌混合 MLP 是空间特定的,因而对空间平移敏感。同时,现有令牌混合 MLP 的通道无关属性限制了其混合令牌的能力。为克服这些局限,我们提出一种称为循环通道特定(CCS)令牌混合 MLP 的改进结构,其空间不变且通道特定。它参数量更少,但在 ImageNet1K 基准上取得了更高的分类精度。

关键词

引用

@article{arxiv.2106.14882,
  title  = {Rethinking Token-Mixing MLP for MLP-based Vision Backbone},
  author = {Tan Yu and Xu Li and Yunfeng Cai and Mingming Sun and Ping Li},
  journal= {arXiv preprint arXiv:2106.14882},
  year   = {2021}
}