面向多目标跟踪的快速自监督深度与掩膜感知关联
计算机视觉与模式识别
2025-10-14 v1
摘要
多目标跟踪(MOT)方法通常依赖交并比(IoU)进行关联。然而,当目标外观相似或发生遮挡时,该方法变得不可靠。此外,针对分割掩膜计算 IoU 在计算上开销较大。本工作中,我们利用分割掩膜捕捉目标形状,但并不计算分割 IoU。取而代之,我们将深度特征与掩膜特征融合,并将其通过一个以自监督方式训练的紧凑编码器。该编码器生成稳定的目标表征,我们将其作为附加的相似性线索,与边界框 IoU 及重识别特征共同用于匹配。我们通过零样本深度估计器获取深度图,并通过可提示式视觉分割模型获取目标掩膜,从而获得细粒度的空间线索。本 MOT 方法首次采用自监督编码器来精炼分割掩膜,而无需计算掩膜 IoU。MOT 可划分为联合检测-重识别(JDR)与跟踪-检测(TBD)两类模型,后者在计算上更为高效。我们在具有非线性运动、遮挡及拥挤场景等挑战性基准(如 SportsMOT 与 DanceTrack)上对所提 TBD 方法进行了实验,结果表明本方法在大多数指标上优于 TBD 现有最优方法,同时在具有线性运动的较简单基准(如 MOT17)上取得了具有竞争力的性能。
引用
@article{arxiv.2510.09878,
title = {Fast Self-Supervised depth and mask aware Association for Multi-Object Tracking},
author = {Milad Khanchi and Maria Amer and Charalambos Poullis},
journal= {arXiv preprint arXiv:2510.09878},
year = {2025}
}