基于相对位置编码的视觉 MLP 跨 token 关系参数化方法
计算机视觉与模式识别
2022-09-13 v2 人工智能
摘要
视觉多层感知机(MLP)在计算机视觉任务中展现出有前景的性能,并成为 CNN 与视觉 Transformer 的主要竞争者。它们使用 token 混合层来捕获跨 token 交互,不同于 Transformer 所使用的多头自注意力机制。然而,重度参数化的 token 混合层天然缺乏捕获局部信息与多粒度非局部关系的机制,因而其判别能力受限。为应对此问题,我们提出一种新的位置空间门控单元(PoSGU)。它利用经典相对位置编码(RPE)中使用的注意力公式,高效地为 token 混合编码跨 token 关系。它能成功将当前视觉 MLP 的二次参数复杂度 降至 与 。我们实验了两种 RPE 机制,并进一步提出一种分组扩展,以在多粒度上下文的达成下提升其表达能力。这些随后作为一类新型视觉 MLP(称为 PosMLP)的关键构建模块。我们通过详尽的实验评估所提方法的有效性,展示了在降低参数复杂度的同时获得改进或可比的性能。例如,对于在 ImageNet1K 上训练的模型,我们实现了性能从 72.14% 提升至 74.02%,以及可学习参数从 降至 。代码见 https://github.com/Zhicaiwww/PosMLP。
引用
@article{arxiv.2207.07284,
title = {Parameterization of Cross-Token Relations with Relative Positional Encoding for Vision MLP},
author = {Zhicai Wang and Yanbin Hao and Xingyu Gao and Hao Zhang and Shuo Wang and Tingting Mu and Xiangnan He},
journal= {arXiv preprint arXiv:2207.07284},
year = {2022}
}