MVFormer:用于高效视觉变换器的多视图特征归一化与token混合扩散
计算机视觉与模式识别
2024-12-02 v1
摘要
当前积极进行研究以提高视觉变换器 (ViT) 的效率。大多数研究仅关注有效的token混合器,忽略了与归一化之间的潜在关系。为提升多样化特征学习,我们提出了两个组件:称为多视图归一化 (MVN) 的归一化模块和称为多视图token混合器 (MVTM) 的token混合器。MVN通过batch归一化、layer归一化和instance归一化三种不同方式对特征进行归一化,并采用可学习的加权求和方式集成这三种归一化方法的输出。每种归一化方法都会输出不同的分布,从而生成不同的特征。因此,MVN预期为token混合器提供多样化的模式信息,实现有益的协同作用。MVTM是一种基于卷积的多尺度token混合器,包含局部、中间和全局滤波器,并通过为每个阶段配置不同的感受野来实现stage特异性,高效地捕获各种范围的视觉模式。我们提出了一种新型ViT模型——多视觉变换器 (MVFormer),在MetaFormer模块中采用MVN和MVTM,作为通用的ViT方案。我们的MVFormer在图像分类、目标检测和实例/语义分割任务上,以相同或更少的参数和MACs,超过了当前最先进的基于卷积的ViT。特别地,MVFormer-T、S和B变体在ImageNet-1K基准测试中分别实现了83.4%、84.3%和84.6%的top-1准确率。
引用
@article{arxiv.2411.18995,
title = {MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers},
author = {Jongseong Bae and Susang Kim and Minsu Cho and Ha Young Kim},
journal= {arXiv preprint arXiv:2411.18995},
year = {2024}
}