RaftMLP:在不使用注意力机制且降低空间局部性的情况下能走多远?
计算机视觉与模式识别
2023-01-13 v3 人工智能
机器学习
摘要
在过去十年中,CNN在计算机视觉领域占据主导地位,但最近Transformer开始崛起。然而,自注意力的二次计算成本在实际应用中已成为一个严重问题。在此背景下,关于无CNN和自注意力架构的研究层出不穷。特别是,MLP-Mixer是一个使用MLP设计的简单架构,其准确率可与Vision Transformer相媲美。然而,该架构中唯一的归纳偏置是token的嵌入。这为在架构中引入非卷积(或非局部)归纳偏置留下了可能性,因此我们利用两个简单的思路,在保持MLP-Mixer捕获全局关联能力的同时,将归纳偏置引入其中。一种方法是沿垂直和水平方向划分token混合块。另一种方法是在token混合的部分通道间使空间关联更加密集。通过这种方法,我们在减少参数量和计算复杂度的同时,提高了MLP-Mixer的准确率。RaftMLP-S这一小模型在参数量和每次计算效率方面可与SOTA的全局MLP模型相媲美。此外,我们利用双三次插值解决了全局MLP模型输入图像分辨率固定的问题。我们证明了这些模型可作为目标检测等下游任务架构的主干网络。然而,其性能并不显著,并指出全局MLP模型需要针对下游任务设计专属的MLP架构。PyTorch版本的源代码可在 \url{https://github.com/okojoalg/raft-mlp} 获取。
引用
@article{arxiv.2108.04384,
title = {RaftMLP: How Much Can Be Done Without Attention and with Less Spatial Locality?},
author = {Yuki Tatsunami and Masato Taki},
journal= {arXiv preprint arXiv:2108.04384},
year = {2023}
}
备注
ACCV2022 accepted