S$^2$-MLPv2:改进的视觉空间移位 MLP 架构
计算机视觉与模式识别
2021-08-03 v1
摘要
近期,基于 MLP 的视觉骨干网络开始涌现。与 CNN 和视觉 Transformer 相比,具有较少归纳偏置的 MLP 视觉架构在图像识别中取得了有竞争力的性能。其中,采用直接空间移位操作的空间移位 MLP(S-MLP)比包括 MLP-mixer 和 ResMLP 在内的开创性工作取得了更好的性能。最近,通过使用更小的图像块和金字塔结构,Vision Permutator(ViP)和 Global Filter Network(GFNet)取得了比 S-MLP 更好的性能。在本文中,我们改进了 S-MLP 视觉骨干网络。我们沿通道维度扩展特征图,并将扩展后的特征图分割成几个部分。我们对分割后的各部分执行不同的空间移位操作。同时,我们利用分割注意力操作来融合这些分割部分。此外,与同类工作类似,我们采用更小尺寸的图像块并使用金字塔结构来提升图像识别准确率。我们将改进后的空间移位 MLP 视觉骨干网络称为 S-MLPv2。使用 55M 参数,我们的中等规模模型 S-MLPv2-Medium 在 ImageNet-1K 基准测试上,使用 224x224 图像,在不使用自注意力和外部训练数据的情况下,达到了 83.6% 的 top-1 准确率。
引用
@article{arxiv.2108.01072,
title = {S$^2$-MLPv2: Improved Spatial-Shift MLP Architecture for Vision},
author = {Tan Yu and Xu Li and Yunfeng Cai and Mingming Sun and Ping Li},
journal= {arXiv preprint arXiv:2108.01072},
year = {2021}
}