中文

Beyond MOT: Semantic Multi-Object Tracking

计算机视觉与模式识别 2024-07-30 v4

摘要

当前的多目标跟踪(MOT)旨在预测视频中目标的轨迹(即“在哪里”)。然而,在许多关键应用中,仅知道“在哪里”是不够的。相比之下,将语义理解(如细粒度行为、交互和整体总结性描述,即“是什么”)与“在哪里”相关联,对于全面的视频分析而言是高度期望的。受此启发,我们引入了语义多目标跟踪(SMOT),旨在估计物体轨迹,同时理解相关轨迹的语义细节,包括实例描述、实例交互和整体视频描述,从而将“在哪里”和“是什么”整合用于跟踪。为了促进 SMOT 的探索,我们提出了 BenSMOT,一个用于语义 MOT 的大规模基准。具体而言,BenSMOT 包含 3,292 个视频和 151K 帧,涵盖了各种人类语义跟踪场景。BenSMOT 提供了目标轨迹的标注,以及相关的自然语言实例描述、实例交互和每个视频序列的整体描述。据我们所知,BenSMOT 是首个公开可用的 SMOT 基准。此外,为了鼓励未来的研究,我们提出了一种名为 SMOTer 的新型跟踪器,该跟踪器专为 SMOT 设计并进行端到端训练,展现出令人期待的性能。通过发布 BenSMOT,我们期望通过预测 SMOT 的“在哪里”和“是什么”来超越传统的 MOT,为视频理解的跟踪开辟新方向。我们将发布 BenSMOT 和 SMOTer,地址为 https://github.com/Nathan-Li123/SMOTer。

关键词

引用

@article{arxiv.2403.05021,
  title  = {Beyond MOT: Semantic Multi-Object Tracking},
  author = {Yunhao Li and Qin Li and Hao Wang and Xue Ma and Jiali Yao and Shaohua Dong and Heng Fan and Libo Zhang},
  journal= {arXiv preprint arXiv:2403.05021},
  year   = {2024}
}

备注

Accepted to ECCV2024