MixFormer:基于迭代混合注意力的端到端跟踪
摘要
视觉目标跟踪通常采用包含特征提取、目标信息整合和边界框估计的多阶段流程。为了简化这一流程并统一特征提取与目标信息整合的过程,在本文中,我们提出了一个基于 Transformer 的紧凑跟踪框架,称为 MixFormer。我们的核心设计是利用注意力操作的灵活性,并提出一个混合注意力模块,用于同时进行特征提取和目标信息整合。这种同步建模方案能够提取目标特定的判别性特征,并在目标和搜索区域之间进行广泛的信息交互。基于 MAM,我们只需堆叠多个 MAM 并在其顶部放置一个定位头,即可构建我们的 MixFormer 跟踪器。具体而言,我们实例化了两种类型的 MixFormer 跟踪器:分层跟踪器 MixCvT 和非分层跟踪器 MixViT。对于这两种跟踪器,我们研究了一系列预训练方法,并揭示了在 MixFormer 跟踪器中监督预训练与自监督预训练之间的不同行为。我们还将掩码预训练扩展到 MixFormer 跟踪器中,并设计了极具竞争力的 TrackMAE 预训练技术。最后,为了处理在线跟踪期间的多个目标模板,我们在 MAM 中设计了一种非对称注意力方案以降低计算成本,并提出一个有效的分数预测模块来选择高质量模板。我们的 MixFormer 跟踪器在七个跟踪基准上取得了新的 SOTA 性能,包括 LaSOT、TrackingNet、VOT2020、GOT-10k、OTB100 和 UAV123。特别是,我们的 MixViT-L 在 LaSOT 上达到 73.3% 的 AUC 分数,在 TrackingNet 上达到 86.1%,在 VOT2020 上达到 0.584 的 EAO,在 GOT-10k 上达到 75.7% 的 AO。代码和训练好的模型已在 https://github.com/MCG-NJU/MixFormer 公开。
关键词
引用
@article{arxiv.2302.02814,
title = {MixFormer: End-to-End Tracking with Iterative Mixed Attention},
author = {Yutao Cui and Cheng Jiang and Gangshan Wu and Limin Wang},
journal= {arXiv preprint arXiv:2302.02814},
year = {2023}
}
备注
Extended version of the paper arXiv:2203.11082 presented at CVPR 2022. In particular, the extented MixViT-L achieves AUC score of 73.3% on LaSOT. Besides, we design a new TrackMAE pre-training method for tracking Code has been released