中文

ConvMLP:用于视觉的分层卷积 MLP

计算机视觉与模式识别 2021-09-21 v2

摘要

基于 MLP 的架构由一系列连续的多层感知机块组成,最近被发现能够达到与卷积和基于 Transformer 的方法相当的结果。然而,大多数架构采用空间 MLP,其接受固定维度的输入,因此难以将其应用于目标检测和语义分割等下游任务。此外,单阶段设计进一步限制了在其他计算机视觉任务中的性能,且全连接层计算量繁重。为了解决这些问题,我们提出了 ConvMLP:一种用于视觉识别的分层卷积 MLP,它是卷积层和 MLP 的轻量级、分阶段协同设计。特别地,ConvMLP-S 在 ImageNet-1k 上以 9M 参数和 2.4G MACs(分别为 MLP-Mixer-B/16 的 15% 和 19%)达到了 76.8% 的 top-1 准确率。在目标检测和语义分割上的实验进一步表明,ConvMLP 学习到的视觉表示可以无缝迁移,并以更少的参数取得有竞争力的结果。我们的代码和预训练模型已在 https://github.com/SHI-Labs/Convolutional-MLPs 公开发布。

关键词

引用

@article{arxiv.2109.04454,
  title  = {ConvMLP: Hierarchical Convolutional MLPs for Vision},
  author = {Jiachen Li and Ali Hassani and Steven Walton and Humphrey Shi},
  journal= {arXiv preprint arXiv:2109.04454},
  year   = {2021}
}