中文

MixFormer:基于迭代混合注意力的端到端跟踪

计算机视觉与模式识别 2022-03-30 v2

摘要

跟踪通常使用特征提取、目标信息整合与边界框估计的多阶段流水线。为简化该流水线并统一特征提取与目标信息整合过程,我们提出一个紧凑的跟踪框架,称为 MixFormer,其构建于 transformer 之上。我们的核心设计是利用注意力操作的灵活性,提出混合注意力模块(MAM)用于同步特征提取与目标信息整合。该同步建模方案允许提取特定目标的判别性特征,并在目标与搜索区域间进行广泛通信。基于 MAM,我们通过堆叠多个带渐进式块嵌入的 MAM 并在顶端放置定位头简单地构建我们的 MixFormer 跟踪框架。此外,为处理在线跟踪中的多目标模板,我们在 MAM 中设计了一种非对称注意力方案以降低计算成本,并提出一个有效的分数预测模块以选择高质量模板。我们的 MixFormer 在五个跟踪基准(包括 LaSOT、TrackingNet、VOT2020、GOT-10k 和 UAV123)上确立了新的最先进性能。特别地,我们的 MixFormer-L 在 LaSOT 上取得 79.9% 的 NP 分数,在 TrackingNet 上取得 88.9%,在 VOT2020 上取得 0.555 的 EAO。我们还进行了深入的消融研究以证明同步特征提取与信息整合的有效性。代码与训练模型公开于 https://github.com/MCG-NJU/MixFormer。

关键词

引用

@article{arxiv.2203.11082,
  title  = {MixFormer: End-to-End Tracking with Iterative Mixed Attention},
  author = {Yutao Cui and Cheng Jiang and Limin Wang and Gangshan Wu},
  journal= {arXiv preprint arXiv:2203.11082},
  year   = {2022}
}

备注

Accepted to CVPR2022 (Oral)