中文

VastTrack:海量类别视觉目标跟踪

计算机视觉与模式识别 2024-03-07 v1

摘要

在本文中,我们介绍了一个名为 VastTrack 的新基准,旨在通过涵盖丰富的类别和视频来促进更通用视觉跟踪的发展。VastTrack 拥有几个吸引人的特性:(1) 海量目标类别。特别是,它涵盖了来自 2,115 个类别的目标对象,远远超过了现有流行基准的对象类别(例如,GOT-10k 有 563 个类别,LaSOT 有 70 个类别)。拥有如此庞大的对象类别,我们期望学习到更通用的对象跟踪。(2) 更大规模。与当前基准相比,VastTrack 提供了 50,610 个序列和 420 万帧,使其成为迄今为止视频数量最大的基准,从而有利于在深度学习时代训练更强大的视觉跟踪器。(3) 丰富标注。除了传统的边界框标注外,VastTrack 还为视频提供了语言描述。VastTrack 丰富的标注使得纯视觉跟踪和视觉 - 语言跟踪的开发成为可能。为确保标注精确,所有视频均经过多轮仔细检查和细化的人工标注。为了了解现有跟踪器的性能并为未来比较提供基准,我们广泛评估了 25 个代表性跟踪器。结果不出所料地显示,由于缺乏来自多样化场景的丰富类别和视频用于训练,其性能较当前数据集显著下降,需要更多努力来改进通用跟踪。我们的 VastTrack 及所有评估结果将公开提供:https://github.com/HengLan/VastTrack。

关键词

引用

@article{arxiv.2403.03493,
  title  = {VastTrack: Vast Category Visual Object Tracking},
  author = {Liang Peng and Junyuan Gao and Xinran Liu and Weihong Li and Shaohua Dong and Zhipeng Zhang and Heng Fan and Libo Zhang},
  journal= {arXiv preprint arXiv:2403.03493},
  year   = {2024}
}

备注

Tech. report