中文

动态分组Transformer:一种具有动态分组注意力的通用视觉Transformer骨干网络

计算机视觉与模式识别 2022-05-30 v4

摘要

近年来,Transformer在各种视觉任务中展现出良好的性能。为了减少每个查询关注所有键/值所带来的二次计算复杂度,已有方法将注意力范围限制在局部区域内,使每个查询仅关注手工设计窗口内的键/值。然而,这些手工设计的窗口划分机制与数据无关,且忽略了输入内容,因此某个查询很可能关注到不相关的键/值。为解决此问题,我们提出动态分组注意力(DG-Attention),它将所有查询动态划分为多个组,并为每组选择最相关的键/值。我们的DG-Attention能够在无需基于手工窗口注意力中所用的任何空间约束下,灵活地建模更相关的依赖关系。基于DG-Attention,我们构建了名为动态分组Transformer(DGT)的通用视觉Transformer骨干网络。大量实验表明,我们的模型在多个常见视觉任务(包括图像分类、语义分割、目标检测和实例分割)上均优于当前最先进(SOTA)方法。

关键词

引用

@article{arxiv.2203.03937,
  title  = {Dynamic Group Transformer: A General Vision Transformer Backbone with Dynamic Group Attention},
  author = {Kai Liu and Tianyi Wu and Cong Liu and Guodong Guo},
  journal= {arXiv preprint arXiv:2203.03937},
  year   = {2022}
}

备注

11 pages, 6 figures. Accepted by IJCAI 2022