中文

TransCenter:具有稠密表示的多目标跟踪Transformer

计算机视觉与模式识别 2022-10-03 v4

摘要

Transformer自提出以来已在广泛任务中展现出优越性能。近年来,其在图像分类与目标检测等视觉任务中引起了关注。尽管有此浪潮,基于Transformer的准确且高效的多目标跟踪(MOT)方法尚待设计。我们认为,直接应用具有二次复杂度且由噪声初始化的不充分稀疏查询的Transformer架构,对MOT并非最优。我们提出TransCenter,一种基于Transformer的MOT架构,采用稠密表示以准确跟踪所有目标并保持合理运行时间。在方法上,我们提出使用图像相关的稠密检测查询,以及由我们精心设计的查询学习网络(QLN)生成的高效稀疏跟踪查询。一方面,图像相关的稠密检测查询使我们能够通过稠密热图输出全局且鲁棒地推断目标位置。另一方面,稀疏跟踪查询集合在我们的TransCenter解码器中高效地与图像特征交互,以随时间关联目标位置。结果,TransCenter表现出显著的性能提升,并在两种标准MOT基准与两种跟踪设置(公开/私有)下大幅优于当前最先进方法。广泛的消融研究及与更朴素替代方案和同期工作的比较也证明了TransCenter的高效与准确。出于科学兴趣,代码已公开于 https://github.com/yihongxu/transcenter。

关键词

引用

@article{arxiv.2103.15145,
  title  = {TransCenter: Transformers with Dense Representations for Multiple-Object Tracking},
  author = {Yihong Xu and Yutong Ban and Guillaume Delorme and Chuang Gan and Daniela Rus and Xavier Alameda-Pineda},
  journal= {arXiv preprint arXiv:2103.15145},
  year   = {2022}
}

备注

17 pages, 10 figures, updated results and add comparisons