将多目标跟踪视为 ID 预测
计算机视觉与模式识别
2025-03-25 v2
摘要
多目标跟踪(MOT)一直是视频理解中的一项长期挑战。一种自然且直观的方法是将此任务分为两部分:目标检测和关联。大多数主流方法采用精心设计的启发式技术来维护轨迹信息并计算用于目标匹配的代价矩阵。尽管这些方法能够取得显著的跟踪性能,但在面对复杂场景时,它们往往需要一系列繁琐的人工修改。我们认为,人工假设的先验限制了方法从特定领域数据中学习最优跟踪能力的适应性和灵活性。因此,我们引入了一种新视角,将多目标跟踪视为上下文 ID 预测任务,将上述目标关联转化为端到端可训练的任务。基于此,我们提出了一种简单而有效的方法,称为 MOTIP。给定一组携带 ID 信息的轨迹,MOTIP 直接为当前检测解码出 ID 标签以完成关联过程。无需使用定制或复杂的架构,我们的方法仅利用目标级特征作为跟踪线索,便在多个基准上取得了 SOTA 的结果。MOTIP 的简洁性和出色的结果为未来的改进留下了充足的空间,从而使其成为后续研究的一个有前景的基线。我们的代码和检查点已发布于 https://github.com/MCG-NJU/MOTIP。
引用
@article{arxiv.2403.16848,
title = {Multiple Object Tracking as ID Prediction},
author = {Ruopeng Gao and Ji Qi and Limin Wang},
journal= {arXiv preprint arXiv:2403.16848},
year = {2025}
}
备注
Accepted by CVPR 2025