动态分组Transformer:一种具有动态分组注意力的通用视觉Transformer骨干网络
计算机视觉与模式识别
2022-05-30 v4
摘要
近年来,Transformer在各种视觉任务中展现出良好的性能。为了减少每个查询关注所有键/值所带来的二次计算复杂度,已有方法将注意力范围限制在局部区域内,使每个查询仅关注手工设计窗口内的键/值。然而,这些手工设计的窗口划分机制与数据无关,且忽略了输入内容,因此某个查询很可能关注到不相关的键/值。为解决此问题,我们提出动态分组注意力(DG-Attention),它将所有查询动态划分为多个组,并为每组选择最相关的键/值。我们的DG-Attention能够在无需基于手工窗口注意力中所用的任何空间约束下,灵活地建模更相关的依赖关系。基于DG-Attention,我们构建了名为动态分组Transformer(DGT)的通用视觉Transformer骨干网络。大量实验表明,我们的模型在多个常见视觉任务(包括图像分类、语义分割、目标检测和实例分割)上均优于当前最先进(SOTA)方法。
引用
@article{arxiv.2203.03937,
title = {Dynamic Group Transformer: A General Vision Transformer Backbone with Dynamic Group Attention},
author = {Kai Liu and Tianyi Wu and Cong Liu and Guodong Guo},
journal= {arXiv preprint arXiv:2203.03937},
year = {2022}
}
备注
11 pages, 6 figures. Accepted by IJCAI 2022