中文

网络结构之争:CNN、Transformer 与 MLP 的实证研究

计算机视觉与模式识别 2021-11-29 v2

摘要

卷积神经网络(CNN)是计算机视觉中占主导地位的深度神经网络(DNN)架构。近来,基于 Transformer 和多层感知机(MLP)的模型,如 Vision Transformer 和 MLP-Mixer,因在 ImageNet 分类任务中展现出有前景的结果而开始引领新趋势。在本文中,我们对这些 DNN 结构进行实证研究,并尝试理解它们各自的优缺点。为确保公平比较,我们首先开发了一个称为 SPACH 的统一框架,该框架对空间和通道处理采用分离模块。我们在 SPACH 框架下的实验表明,所有结构在中等规模下都能取得有竞争力的性能。然而,当网络规模扩大时,它们表现出截然不同的行为。基于我们的发现,我们提出了两种使用卷积和 Transformer 模块的混合模型。所得的 Hybrid-MS-S+ 模型以 63M 参数和 12.3G FLOPS 实现了 83.9% 的 top-1 准确率,已经与具有精巧设计的 SOTA 模型相当。代码和模型已在 https://github.com/microsoft/SPACH 公开可用。

关键词

引用

@article{arxiv.2108.13002,
  title  = {A Battle of Network Structures: An Empirical Study of CNN, Transformer, and MLP},
  author = {Yucheng Zhao and Guangting Wang and Chuanxin Tang and Chong Luo and Wenjun Zeng and Zheng-Jun Zha},
  journal= {arXiv preprint arXiv:2108.13002},
  year   = {2021}
}