中文

GRASPTrack:基于分割与投影的几何推理关联用于多目标跟踪

计算机视觉与模式识别 2025-08-12 v1 人工智能

摘要

单目视频中的多目标跟踪(Multi-Object Tracking,MOT)面临遮挡和深度歧义问题,传统基于检测的跟踪方法由于缺乏几何感知,难以解决这些问题。为此,我们提出 GRASPTrack,一种新型深度感知 MOT 框架,将单目深度估计和实例分割集成到标准基于检测的跟踪管道中,从 2D 检测生成高保真 3D 点云,从而实现显式的 3D 几何推理。这些 3D 点云随后被体素化,以实现精确且稳健的基于体素的 3D 交并比(Voxel-Based 3D Intersection-over-Union,IoU)用于空间关联。为进一步提升跟踪鲁棒性,我们采用深度感知自适应噪声补偿,动态调整卡尔曼滤波过程噪声,以适应遮挡程度,实现更可靠的状态估计。此外,我们提出深度增强的观察中心动量方法,将图像平面上的运动方向一致性扩展到 3D 空间,以提高基于运动的关联线索,尤其适用于运动轨迹复杂的目标。广泛实验表明,在 MOT17、MOT20 和 DanceTrack 数据集上,我们的方法实现了竞争性能,显著提升了在频繁遮挡和复杂运动模式场景中的跟踪鲁棒性。

关键词

引用

@article{arxiv.2508.08117,
  title  = {GRASPTrack: Geometry-Reasoned Association via Segmentation and Projection for Multi-Object Tracking},
  author = {Xudong Han and Pengcheng Fang and Yueying Tian and Jianhui Yu and Xiaohao Cai and Daniel Roggen and Philip Birch},
  journal= {arXiv preprint arXiv:2508.08117},
  year   = {2025}
}