用于图像识别的稀疏MLP:自注意力真的是必要的吗?
计算机视觉与模式识别
2022-05-31 v2
摘要
Transformer已在计算机视觉领域迅速兴起。在本工作中,我们探究Transformer中的核心自注意力模块是否是图像识别取得优异性能的关键。为此,我们基于现有的基于MLP的视觉模型构建了一个无注意力网络,称为sMLPNet。具体而言,我们将token混合步骤中的MLP模块替换为一种新颖的稀疏MLP(sMLP)模块。对于2D图像token,sMLP沿轴向应用1D MLP,且参数在行或列之间共享。通过稀疏连接和权重共享,sMLP模块显著减少了模型参数量和计算复杂度,避免了困扰类MLP模型性能的常见的过拟合问题。当仅在ImageNet-1K数据集上训练时,所提出的sMLPNet以仅24M参数实现了81.9%的top-1准确率,在相同模型大小约束下远优于大多数CNN和视觉Transformer。当扩展到66M参数时,sMLPNet实现了83.4%的top-1准确率,与最先进的Swin Transformer相当。sMLPNet的成功表明,自注意力机制并非计算机视觉中的万能钥匙。代码和模型已公开于 https://github.com/microsoft/SPACH
引用
@article{arxiv.2109.05422,
title = {Sparse MLP for Image Recognition: Is Self-Attention Really Necessary?},
author = {Chuanxin Tang and Yucheng Zhao and Guangting Wang and Chong Luo and Wenxuan Xie and Wenjun Zeng},
journal= {arXiv preprint arXiv:2109.05422},
year = {2022}
}
备注
Accepted by AAAI2022