DepTR-MOT:探索基于深度信息的轨迹细化在多目标跟踪中的潜力
计算机视觉与模式识别
2025-09-23 v1 机器人学
图像与视频处理
摘要
视觉多目标跟踪(MOT)是机器人感知的关键组成部分,但现有的基于检测的跟踪方法(TBD)往往依赖2D线索,如边界框和运动建模,在遮挡和近距离相互作用情况下难以应对。依赖这些2D线索的跟踪器在机器人环境中尤其不可靠,因为目标稠密且遮挡频繁。虽然深度信息有潜力缓解这些问题,但大多数现有MOT数据集缺乏深度标注,导致该领域未充分利用。为探索深度信息驱动的轨迹细化潜力,我们提出DepTR-MOT,一种集成实例级深度信息的DETR基检测器。具体而言,我们提出两种关键创新:(i) 基于基础模型的实例级软深度标签监督,细化深度预测;(ii) 将稠密深度图蒸馏以维持全局深度一致性。这些策略使DepTR-MOT在推理时能够输出实例级深度,而无需基础模型、无需额外计算开销。通过融合深度线索,我们的方法增强了TBD范式的鲁棒性,有效解决遮挡和近距离挑战。在QuadTrack和DanceTrack数据集上进行实验,分别实现HOTA得分27.59和44.47。特别是,QuadTrack(机器人平台MOT数据集)的结果凸显了我们方法在处理遮挡和近距离挑战方面的优势。源代码将公开于 https://github.com/warriordby/DepTR-MOT。
引用
@article{arxiv.2509.17323,
title = {DepTR-MOT: Unveiling the Potential of Depth-Informed Trajectory Refinement for Multi-Object Tracking},
author = {Buyin Deng and Lingxin Huang and Kai Luo and Fei Teng and Kailun Yang},
journal= {arXiv preprint arXiv:2509.17323},
year = {2025}
}
备注
The source code will be made publicly available at https://github.com/warriordby/DepTR-MOT