中文

MeMOTR:用于多目标跟踪的长时记忆增强 Transformer

计算机视觉与模式识别 2024-02-22 v3

摘要

作为一项视频任务,多目标跟踪(MOT)期望有效捕获目标的时间信息。遗憾的是,大多数现有方法仅显式利用相邻帧间的目标特征,缺乏建模长时程时间信息的能力。本文中,我们提出 MeMOTR,一种用于多目标跟踪的长时记忆增强 Transformer。我们的方法借助定制记忆注意力层注入长时记忆,能够使同一目标的跟踪嵌入更加稳定且具区分性,这显著提升了模型的目标关联能力。DanceTrack 上的实验结果表明,MeMOTR 在 HOTA 与 AssA 指标上分别以 7.9% 和 13.0% 的优势超越最先进(state-of-the-art)方法。此外,我们的模型在 MOT17 上的关联性能也优于其他基于 Transformer 的方法,并在 BDD100K 上泛化良好。代码见 https://github.com/MCG-NJU/MeMOTR。

关键词

引用

@article{arxiv.2307.15700,
  title  = {MeMOTR: Long-Term Memory-Augmented Transformer for Multi-Object Tracking},
  author = {Ruopeng Gao and Limin Wang},
  journal= {arXiv preprint arXiv:2307.15700},
  year   = {2024}
}

备注

Accepted by ICCV 2023. In the latest version, we report the results on SportsMOT