中文

ByteTrack:通过关联每一个检测框实现多目标跟踪

计算机视觉与模式识别 2022-04-08 v3

摘要

多目标跟踪(MOT)旨在估计视频中物体的边界框与身份。大多数方法通过关联得分高于阈值的检测框来获取身份。得分较低的物体(例如被遮挡的物体)被直接丢弃,这带来了不可忽略的真实物体丢失与轨迹碎片化。为解决该问题,我们提出了一种简单、有效且通用的关联方法,即通过关联几乎每一个检测框而非仅高分框来进行跟踪。对于低分检测框,我们利用其与轨迹片段(tracklet)的相似度来恢复真实物体并滤除背景检测。当应用于 9 种不同的先进跟踪器时,我们的方法在 IDF1 分数上取得了 1 到 10 分的稳定提升。为推进 MOT 的先进性能,我们设计了一个简单而强大的跟踪器,名为 ByteTrack。我们首次在 MOT17 测试集上以单张 V100 GPU 上 30 FPS 的运行速度取得了 80.3 MOTA、77.3 IDF1 和 63.1 HOTA。ByteTrack 在 MOT20、HiEve 和 BDD100K 跟踪基准上也取得了先进性能。源代码、预训练模型(含部署版本)以及应用于其他跟踪器的教程发布于 https://github.com/ifzhang/ByteTrack。

关键词

引用

@article{arxiv.2110.06864,
  title  = {ByteTrack: Multi-Object Tracking by Associating Every Detection Box},
  author = {Yifu Zhang and Peize Sun and Yi Jiang and Dongdong Yu and Fucheng Weng and Zehuan Yuan and Ping Luo and Wenyu Liu and Xinggang Wang},
  journal= {arXiv preprint arXiv:2110.06864},
  year   = {2022}
}