S$^2$-MLP:面向视觉的空间移位 MLP 架构
计算机视觉与模式识别
2021-06-24 v2 人工智能
机器学习
摘要
近来,视觉 Transformer (ViT) 及其后续工作摒弃卷积并引入自注意力操作,获得了与 CNN 相当甚至更高的准确率。更近一些,MLP-Mixer 同时放弃卷积与自注意力操作,提出了一种仅含 MLP 层的架构。为实现跨图像块通信,它在通道混合 MLP 之外设计了额外的 token 混合 MLP。在极大规模数据集上训练时取得了有前景的结果,但在 ImageNet1K 和 ImageNet21K 等中等规模数据集上训练时,其性能无法达到与其 CNN 和 ViT 对应模型相媲美的出色水平。MLP-Mixer 的性能下降促使我们重新思考 token 混合 MLP。我们发现 token 混合 MLP 是一种具有全局感受野和空间特定配置的深度可分离卷积的变体。但全局感受野与空间特定属性使 token 混合 MLP 易于过拟合。本文提出一种新颖的纯 MLP 架构——空间移位 MLP (S-MLP)。与 MLP-Mixer 不同,我们的 S-MLP 仅包含通道混合 MLP。我们利用空间移位操作实现图像块间通信,该操作具有局部感受野且空间无关,无需参数且计算高效。所提 S-MLP 在 ImageNet-1K 数据集上训练时取得了高于 MLP-Mixer 的识别准确率,同时以显著更简单的架构和更少的 FLOPs 与参数量,在 ImageNet-1K 数据集上取得了与 ViT 同样优异的性能。
引用
@article{arxiv.2106.07477,
title = {S$^2$-MLP: Spatial-Shift MLP Architecture for Vision},
author = {Tan Yu and Xu Li and Yunfeng Cai and Mingming Sun and Ping Li},
journal= {arXiv preprint arXiv:2106.07477},
year = {2021}
}