MAFormer:一种用于视觉识别的多尺度注意力融合Transformer网络
计算机视觉与模式识别
2022-09-07 v1
摘要
Vision Transformer 及其变体已在各类计算机视觉任务中展现出巨大潜力。但常规视觉 transformer 常关注粗粒度的全局依赖,面临在 token 层面学习全局关系与细粒度表示的挑战。本文中,我们引入多尺度注意力融合至 transformer (MAFormer),其在双流框架中探索局部聚合与全局特征提取以用于视觉识别。我们开发了一个简单而有效的模块,通过在 token 层面学习细粒度与粗粒度特征并动态融合它们,来挖掘 transformer 在视觉表示上的全部潜力。我们的多尺度注意力融合(MAF)块包含:i)一个局部窗口注意力分支,学习窗口内短程交互,聚合细粒度局部特征;ii)通过一种新颖的带下采样全局学习(GLD)操作进行全局特征提取,以高效捕获整幅图像内的长程上下文信息;iii)一个通过注意力自探索两类特征融合的融合模块。我们的 MAFormer 在常见视觉任务上取得最先进性能。特别地,MAFormer-L 在 ImageNet 上达到 85.9 的 Top-1 准确率,分别超越 CSWin-B 与 LV-ViT-L 达 1.7 与 0.6。在 MSCOCO 上,MAFormer 以相近参数量在目标检测上超越先前最优的 CSWin 达 1.7 mAPs,在实例分割上达 1.4,展示了其作为通用骨干网络的潜力。
引用
@article{arxiv.2209.01620,
title = {MAFormer: A Transformer Network with Multi-scale Attention Fusion for Visual Recognition},
author = {Yunhao Wang and Huixin Sun and Xiaodi Wang and Bin Zhang and Chao Li and Ying Xin and Baochang Zhang and Errui Ding and Shumin Han},
journal= {arXiv preprint arXiv:2209.01620},
year = {2022}
}
备注
9 pages, 2 figures