中文

X-MLP:一种无块嵌入的视觉 MLP 架构

计算机视觉与模式识别 2023-07-04 v1

摘要

卷积神经网络(CNN)与视觉 Transformer(ViT)在计算机视觉中已取得巨大成就。近来,面向视觉的多层感知机(MLP)架构研究再度兴起。视觉 MLP 被设计为独立于卷积与自注意力操作。然而,现有视觉 MLP 架构总是依赖卷积进行块嵌入。因此我们提出 X-MLP,一种完全构建于全连接层且免于块嵌入的架构。它极度解耦特征,并利用 MLP 独立且交替地在宽度、高度与通道维度间交互信息。X-MLP 在十个基准数据集上测试,均取得优于其他视觉 MLP 模型的性能,甚至在多个数据集上以明显优势超越 CNN。此外,通过数学还原空间权重,我们可视化了特征图中任意像素对之间的信息通信,并观察到捕获长程依赖的现象。

关键词

引用

@article{arxiv.2307.00592,
  title  = {X-MLP: A Patch Embedding-Free MLP Architecture for Vision},
  author = {Xinyue Wang and Zhicheng Cai and Chenglei Peng},
  journal= {arXiv preprint arXiv:2307.00592},
  year   = {2023}
}

备注

IJCNN 2023