中文

TrackFormer:基于 Transformer 的多目标跟踪

计算机视觉与模式识别 2022-05-02 v3

摘要

多目标跟踪(MOT)这一具有挑战性的任务需要同时对轨迹初始化、身份以及时空轨迹进行推理。我们将该任务表述为帧到帧的集合预测问题,并介绍 TrackFormer,一种基于编码器-解码器 Transformer 架构的端到端可训练 MOT 方法。我们的模型通过注意力在视频序列中演化一组跟踪预测,从而实现帧间的数据关联。Transformer 解码器从静态目标查询初始化新轨迹,并以概念上新颖且保持身份的跟踪查询在时空上自回归地跟随已有轨迹。两类查询均受益于对全局帧级特征的自注意力与编码器-解码器注意力,从而省去了任何额外的图优化或运动及/或外观建模。TrackFormer 引入了一种新的基于注意力的跟踪范式,其设计虽简单,却能在多目标跟踪(MOT17 和 MOT20)与分割(MOTS20)任务上取得最先进的性能。代码可在 https://github.com/timmeinhardt/trackformer 获取。

关键词

引用

@article{arxiv.2101.02702,
  title  = {TrackFormer: Multi-Object Tracking with Transformers},
  author = {Tim Meinhardt and Alexander Kirillov and Laura Leal-Taixe and Christoph Feichtenhofer},
  journal= {arXiv preprint arXiv:2101.02702},
  year   = {2022}
}