中文

可见-热成像多目标跟踪:大规模视频数据集与渐进式融合方法

计算机视觉与模式识别 2024-08-05 v1

摘要

可见光和热红外数据的互补优势在计算机视觉任务中被广泛利用,如视觉跟踪、语义分割和目标检测,但在多目标跟踪(MOT)中鲜有探索。本文我们贡献了一个大规模可见-热成像视频基准数据集,称为VT-MOT。VT-MOT具有以下主要优势:1)数据规模大且多样性强。VT-MOT包括582对视频序列,40.1万帧对,来自监控、无人机和手持平台。2)跨模态对齐高度精确。我们邀请了多位专业人员逐帧进行空间和时间对齐。3)标注稠密且质量高。VT-MOT标注了399万个标注框,由专业人员进行双重检查,包括重遮挡和目标再捕获(目标消失和重新出现)挑战。为提供强大的基线,我们设计了一个简单而有效的跟踪框架,有效地以渐进方式融合两个模态的时序信息和互补信息,以实现稳健的可见-热成像MOT。在VT-MOT上进行了全面实验,结果证明了所提出方法在与当前最先进方法相比方面的优越性和有效性。根据评估结果和分析,我们指定了若干潜在的未来方向供可见-热成像MOT参考。该项目已发布于https://github.com/wqw123wqw/PFTrack。

关键词

引用

@article{arxiv.2408.00969,
  title  = {Visible-Thermal Multiple Object Tracking: Large-scale Video Dataset and Progressive Fusion Approach},
  author = {Yabin Zhu and Qianwu Wang and Chenglong Li and Jin Tang and Zhixiang Huang},
  journal= {arXiv preprint arXiv:2408.00969},
  year   = {2024}
}