混合与移位:在视觉MLP中利用全局与局部依赖
计算机视觉与模式识别
2022-02-15 v1
摘要
令牌混合多层感知机(MLP)模型以简单的架构和相对较小的计算成本在计算机视觉任务中展现出具有竞争力的性能。它们在保持计算效率方面的成功主要归因于避免使用通常计算量大的自注意力,但这是以无法同时全局和局部混合令牌为代价的。在本文中,为了在不使用自注意力的情况下利用全局和局部依赖,我们提出了Mix-Shift-MLP(MS-MLP),其使得用于混合的局部感受野大小随空间移位量的增加而增大。除了常规的混合和移位技术外,MS-MLP从细粒度到粗粒度级别混合相邻和远距离令牌,然后通过移位操作将它们聚集。这直接促进了全局与局部令牌之间的交互。MS-MLP实现简单,在多个视觉基准上取得了具有竞争力的性能。例如,一个拥有8500万参数的MS-MLP在ImageNet-1K上达到了83.8%的top-1分类准确率。此外,通过将MS-MLP与最先进的视觉Transformer(如Swin Transformer)结合,我们展示了MS-MLP在三种不同模型规模上实现了进一步提升,例如在ImageNet-1K分类上用Swin-B提升了0.5%。代码可在:https://github.com/JegZheng/MS-MLP 获取。
引用
@article{arxiv.2202.06510,
title = {Mixing and Shifting: Exploiting Global and Local Dependencies in Vision MLPs},
author = {Huangjie Zheng and Pengcheng He and Weizhu Chen and Mingyuan Zhou},
journal= {arXiv preprint arXiv:2202.06510},
year = {2022}
}