中文

SportsMOT:一个多运动场景的大规模多目标跟踪数据集

计算机视觉与模式识别 2023-04-14 v2

摘要

运动场景中的多目标跟踪在收集球员统计数据、支持如自动战术分析等进一步分析中起着关键作用。然而现有的 MOT 基准对该领域的关注甚少,限制了其发展。本工作中,我们提出了一个多样化运动场景下的新型大规模多目标跟踪数据集,称为 \emph{SportsMOT},其中场上所有球员均须被跟踪。该数据集包含 240 个视频序列、超过 150K 帧(约为 MOT17 的 15 倍)以及采集自篮球、排球和足球三类运动的超过 1.6M 个边界框(3 倍于 MOT17)。我们的数据集具有两个关键特性:1)快速且变速的运动;2)相似但可区分的外观。我们期望 SportsMOT 能推动 MOT 跟踪器在基于运动的关联和基于外观的关联上均取得进步。我们对若干最先进跟踪器进行了基准测试,并揭示 SportsMOT 的关键挑战在于目标关联。为缓解该问题,我们进一步提出了一种新型多目标跟踪框架,称为 \emph{MixSort},将类 MixFormer 的结构作为辅助关联模型引入主流的跟踪-by-检测跟踪器中。通过将定制的基于外观的关联与原始基于运动的关联相整合,MixSort 在 SportsMOT 和 MOT17 上均达到了最先进性能。基于 MixSort,我们给出了深入分析并提供了关于 SportsMOT 的一些深刻见解。数据集与代码将发布于 https://deeperaction.github.io/datasets/sportsmot.html。

关键词

引用

@article{arxiv.2304.05170,
  title  = {SportsMOT: A Large Multi-Object Tracking Dataset in Multiple Sports Scenes},
  author = {Yutao Cui and Chenkai Zeng and Xiaoyu Zhao and Yichun Yang and Gangshan Wu and Limin Wang},
  journal= {arXiv preprint arXiv:2304.05170},
  year   = {2023}
}