中文

用于多目标跟踪的运动感知 Transformer

计算机视觉与模式识别 2026-03-10 v3

摘要

由于复杂的物体运动和拥挤的场景,视频中的多目标跟踪 (MOT) 仍然具有挑战性。近期基于 DETR 的框架提供了端到端解决方案,但通常在单个 Transformer 解码器层内联合处理检测和跟踪查询,导致冲突并降低关联准确度。我们引入了运动感知 Transformer (MATR),它显式预测跨帧的物体运动以提前更新跟踪查询。通过减少查询冲突,MATR 能够实现更一致的训练,并改进检测和关联。在 DanceTrack、SportsMOT 和 BDD100k 上的大量实验表明,MATR 在标准指标上取得了显著提升。在 DanceTrack 上,MATR 在没有额外数据的情况下比 MOTR 提高了 9 个点以上的 HOTA,并在使用补充数据时达到了 71.3 的新的最先进分数。在不依赖外部数据集的情况下,MATR 还在 SportsMOT (72.2 HOTA) 和 BDD100k (54.7 mTETA, 41.6 mHOTA) 上取得了最先进的结果。这些结果表明,在端到端 Transformer 内显式建模运动为推进多目标跟踪提供了一种简单而高效的方法。

关键词

引用

@article{arxiv.2509.21715,
  title  = {Motion-Aware Transformer for Multi-Object Tracking},
  author = {Xu Yang and Gady Agam},
  journal= {arXiv preprint arXiv:2509.21715},
  year   = {2026}
}