中文

面向视觉的 MetaFormer 基线模型

计算机视觉与模式识别 2024-12-03 v4 人工智能 机器学习

摘要

MetaFormer 作为 Transformer 的抽象架构,已被发现对取得具有竞争力的性能起着重要作用。在本文中,我们进一步探索 MetaFormer 的能力,再次不聚焦于令牌混合器设计:我们采用最基础或最常见的混合器,在 MetaFormer 下引入若干基线模型,并将观察总结如下:(1)MetaFormer 确保了性能的坚实下界。仅采用恒等映射作为令牌混合器,这一称为 IdentityFormer 的 MetaFormer 模型在 ImageNet-1K 上取得了 >80% 的准确率。(2)MetaFormer 适用于任意令牌混合器。当将令牌混合器指定为甚至一个随机矩阵来混合令牌时,所得模型 RandFormer 取得了 >81% 的准确率,优于 IdentityFormer。当采用新令牌混合器时,尽可放心于 MetaFormer 的结果。(3)MetaFormer 可轻松提供最先进结果。仅用五年前的常规令牌混合器,从 MetaFormer 实例化的模型已然击败最先进水平。(a)ConvFormer 优于 ConvNeXt。以常见的深度可分离卷积作为令牌混合器,称为 ConvFormer 的模型可视为纯 CNN,其优于强大的 CNN 模型 ConvNeXt。(b)CAFormer 在 ImageNet-1K 上创下新纪录。仅需在底层阶段应用深度可分离卷积、在顶层阶段应用原生自注意力,所得模型 CAFormer 在 ImageNet-1K 上创下新纪录:在 224x224 分辨率下、无外部数据或蒸馏的常规监督训练中取得 85.5% 的准确率。在探究 MetaFormer 的历程中,我们还发现一种新激活函数 StarReLU 相比 GELU 减少了 71% 的激活 FLOPs,却取得更优性能。我们期望 StarReLU 在 MetaFormer 类模型及其他神经网络中发掘巨大潜力。

关键词

引用

@article{arxiv.2210.13452,
  title  = {MetaFormer Baselines for Vision},
  author = {Weihao Yu and Chenyang Si and Pan Zhou and Mi Luo and Yichen Zhou and Jiashi Feng and Shuicheng Yan and Xinchao Wang},
  journal= {arXiv preprint arXiv:2210.13452},
  year   = {2024}
}

备注

Accepted to TPAMI. Code: https://github.com/sail-sg/metaformer