Z-GMOT:零样本通用多目标跟踪
计算机视觉与模式识别
2024-06-14 v4
摘要
尽管近期取得了显著进展,多目标跟踪(MOT)仍面临依赖先验知识与预定义类别、难以处理未见物体等局限。为应对这些问题,通用多目标跟踪(GMOT)作为一种替代方案应运而生,其所需先验信息更少。然而,当前 GMOT 方法常依赖初始边界框,且难以应对视角、光照、遮挡与尺度等因素的变化。我们的贡献首先在于引入 Referring GMOT 数据集,该数据集由若干视频组成,每个视频均附有对其属性的详细文本描述。随后,我们提出 ,一种前沿的跟踪方案,能够在无需初始边界框或预定义类别的情况下,跟踪来自\textit{从未见过的类别}的物体。在 框架内,我们引入两个新颖组件:(i),一种改进的 Grounded 语言-图像预训练方法,用于准确检测具有特定特征的未见物体;(ii),一种新颖的物体关联方法,巧妙融合基于运动与外观的匹配策略,以应对高相似度物体跟踪这一复杂任务。我们通过在该 Referring GMOT 数据集上针对 GMOT 任务开展大量实验,对所提贡献进行了基准评测。此外,为评估所提 的泛化能力,我们在 DanceTrack 与 MOT20 数据集上针对 MOT 任务进行了消融研究。我们的数据集、代码与模型发布于:https://fsoft-aic.github.io/Z-GMOT。
引用
@article{arxiv.2305.17648,
title = {Z-GMOT: Zero-shot Generic Multiple Object Tracking},
author = {Kim Hoang Tran and Anh Duy Le Dinh and Tien Phat Nguyen and Thinh Phan and Pha Nguyen and Khoa Luu and Donald Adjeroh and Gianfranco Doretto and Ngan Hoang Le},
journal= {arXiv preprint arXiv:2305.17648},
year = {2024}
}