尺度感知调制遇上 Transformer
摘要
本文提出一种新的视觉 Transformer——尺度感知调制 Transformer (Scale-Aware Modulation Transformer, SMT),它通过结合卷积网络与视觉 Transformer,能够高效地处理各种下游任务。SMT 中提出的尺度感知调制(SAM)包含两个主要新颖设计。首先,我们引入多头混合卷积(Multi-Head Mixed Convolution, MHMC)模块,该模块可捕获多尺度特征并扩大感受野。其次,我们提出尺度感知聚合(Scale-Aware Aggregation, SAA)模块,该模块轻量但有效,能够实现不同头之间的信息融合。通过利用这两个模块,卷积调制得到进一步增强。此外,与先前工作在所有阶段使用调制以构建无注意力网络不同,我们提出了演化混合网络(Evolutionary Hybrid Network, EHN),它能有效模拟随着网络加深而从捕获局部依赖到全局依赖的转变,从而获得更优性能。大量实验表明,SMT 在广泛的视觉任务上显著优于现有的最先进(state-of-the-art, SOTA)模型。具体而言,具有 11.5M / 2.4GFLOPs 和 32M / 7.7GFLOPs 的 SMT 在 ImageNet-1K 上分别可达到 82.2% 和 84.3% 的 top-1 准确率。在 224^2 分辨率下于 ImageNet-22K 上预训练后,其在 224^2 和 384^2 分辨率微调时分别达到 87.1% 和 88.1% 的 top-1 准确率。对于使用 Mask R-CNN 的目标检测,以 1x 和 3x 调度训练的 SMT base 在 COCO 上分别比 Swin Transformer 对应模型高出 4.2 和 1.3 mAP。对于使用 UPerNet 的语义分割,SMT base 在单尺度和多尺度下测试分别在 ADE20K 上超越 Swin 2.0 和 1.1 mIoU。
引用
@article{arxiv.2307.08579,
title = {Scale-Aware Modulation Meet Transformer},
author = {Weifeng Lin and Ziheng Wu and Jiayu Chen and Jun Huang and Lianwen Jin},
journal= {arXiv preprint arXiv:2307.08579},
year = {2023}
}
备注
Accepted to ICCV 2023