中文

TP-GMOT:基于文本提示的通用多目标跟踪与运动-外观代价 (MAC) SORT

计算机视觉与模式识别 2024-09-05 v1

摘要

虽然多目标跟踪 (MOT) 已取得显著进展,但其仍严重依赖先验知识且局限于预定义类别。相比之下,通用多目标跟踪 (GMOT) 所需的先验信息更少,但面临视角、光照、遮挡和分辨率等变体问题。我们的贡献首先引入了 \textbf{Refer-GMOT 数据集},包含一系列视频,每个视频都伴随其属性的细粒度文本描述。随后,我们提出一种新型基于文本提示的开放词汇 GMOT 框架,即 \textbf{TP-GMOT},可实现零样本跟踪从未见过的对象类别。在 \textbf{TP-GMOT} 框架内,我们引入两个新组件:(i) \textbf{TP-OD},一种基于文本提示的对象检测方法,可准确检测具有特定特征的未知对象。(ii) 运动-外观代价 SORT \textbf{MAC-SORT},一种新型对象关联方法,善于整合运动和外观匹配策略,以解决跟踪高度相似的多个通用对象的复杂任务。我们的工作在 \textbf{Refer-GMOT} 数据集上进行基准测试以评估 GMOT 任务。此外,为评估 \textbf{TP-GMOT} 框架的通用性和 \textbf{MAC-SORT} 跟踪器的有效性,我们在 DanceTrack 和 MOT20 数据集上进行了消融研究以评估 MOT 任务。我们的数据集、代码和模型将在 https://fsoft-aic.github.io/TP-GMOT 上公开。

关键词

引用

@article{arxiv.2409.02490,
  title  = {TP-GMOT: Tracking Generic Multiple Object by Textual Prompt with Motion-Appearance Cost (MAC) SORT},
  author = {Duy Le Dinh Anh and Kim Hoang Tran and Ngan Hoang Le},
  journal= {arXiv preprint arXiv:2409.02490},
  year   = {2024}
}