以分组混合注意力推进视觉 Transformer
计算机视觉与模式识别
2023-11-28 v1
摘要
视觉 Transformer(ViT)已通过以多头自注意力(MHSA)建模长程依赖来增强视觉识别,而 MHSA 通常表述为查询-键-值计算。然而,由查询与键生成的注意力图仅以单一粒度捕捉令牌到令牌的相关性。本文中,我们认为自注意力应具备更全面的机制,以捕捉令牌与组(即多个相邻令牌)之间的相关性,从而获得更高的表示能力。为此,我们提出分组混合注意力(GMA)作为传统自注意力的进阶替代,其能以多种组大小同时捕捉令牌到令牌、令牌到组以及组到组的相关性。为此,GMA 将查询、键与值均匀分段,并执行不同的组聚合以生成组代理。注意力图基于令牌与组代理的混合计算,并用于重新组合值中的令牌与组。基于 GMA,我们引入一个强劲的骨干网络,即 GroupMixFormer,其在图像分类、目标检测与语义分割上以少于现有模型的参数量取得最先进性能。例如,GroupMixFormer-L(含 70.3M 参数与 384^2 输入)在无外部数据下于 ImageNet-1K 取得 86.2% 的 Top-1 准确率,而 GroupMixFormer-B(含 45.8M 参数)于 ADE20K 取得 51.2% mIoU。
引用
@article{arxiv.2311.15157,
title = {Advancing Vision Transformers with Group-Mix Attention},
author = {Chongjian Ge and Xiaohan Ding and Zhan Tong and Li Yuan and Jiangliu Wang and Yibing Song and Ping Luo},
journal= {arXiv preprint arXiv:2311.15157},
year = {2023}
}