MetaFormer 实为视觉任务之所需
摘要
Transformers 在计算机视觉任务中展现出巨大潜力。一种普遍看法是其基于注意力的 token mixer 模块对模型能力贡献最大。然而,近期工作表明 Transformers 中基于注意力的模块可被空间 MLP 替代,且所得模型仍表现良好。基于该观察,我们假设 Transformers 的通用架构而非特定的 token mixer 模块对模型性能更为关键。为验证此点,我们有意将 Transformers 中的注意力模块替换为极其简单的空间池化算子以仅进行基础 token 混合。令人惊讶的是,我们观察到所得模型(称为 PoolFormer)在多个计算机视觉任务上取得了具竞争力的性能。例如在 ImageNet-1K 上,PoolFormer 取得了 82.1% 的 top-1 准确率,以少 35%/52% 的参数和少 50%/62% 的 MACs 分别超越精心调优的 Vision Transformer/类MLP基线 DeiT-B/ResMLP-B24 达 0.3%/1.1% 准确率。PoolFormer 的有效性验证了我们的假设,并促使我们提出“MetaFormer”这一概念,即从 Transformers 中抽象出的不指定 token mixer 的通用架构。基于大量实验,我们认为 MetaFormer 是近期 Transformer 和类MLP模型在视觉任务上取得优异结果的关键角色。本工作呼吁未来更多研究致力于改进 MetaFormer 而非聚焦于 token mixer 模块。此外,我们提出的 PoolFormer 可作为未来 MetaFormer 架构设计的起始基线。代码见 https://github.com/sail-sg/poolformer。
引用
@article{arxiv.2111.11418,
title = {MetaFormer Is Actually What You Need for Vision},
author = {Weihao Yu and Mi Luo and Pan Zhou and Chenyang Si and Yichen Zhou and Xinchao Wang and Jiashi Feng and Shuicheng Yan},
journal= {arXiv preprint arXiv:2111.11418},
year = {2022}
}
备注
CVPR 2022 (Oral). Code: https://github.com/sail-sg/poolformer