基于深度学习的多目标跟踪:从基础到最新方法的综合 surveys
计算机视觉与模式识别
2025-06-17 v1
摘要
多目标跟踪(Multi-object tracking, MOT)是计算机视觉中的核心任务,涉及在视频帧中检测对象并在时间上对其进行关联。在深度学习的兴起后,MOT 取得了显著进展,尤其是在以检测-跟踪为主的范式中,该范式仍为主导方法。现代深度学习方法的进步于 2022 年通过 ByteTrack 用于检测-跟踪和 MOTR 用于端到端跟踪而加速。我们的调查提供了对深度学习方法的深入分析,将检测-跟踪方法系统性地划分为五组:联合检测与嵌入、基于启发式的方法、基于运动的方法、基于关联学习的方法和离线方法此外,我们还检查了端到端跟踪方法并将其与现有替代方法进行了比较。我们评估了最近跟踪器在多个基准数据集上的性能,并特别通过在不同领域之间的结果比较来评估其通用性。我们的发现表明,基于启发式的方法在线性目标运动的密集数据集上实现了最新性能,而深度学习的关联方法无论是检测-跟踪还是端到端方法,在复杂运动模式的场景中都表现出色。
引用
@article{arxiv.2506.13457,
title = {Deep Learning-Based Multi-Object Tracking: A Comprehensive Survey from Foundations to State-of-the-Art},
author = {Momir Adžemović},
journal= {arXiv preprint arXiv:2506.13457},
year = {2025}
}
备注
39 pages