LaMOT:语言引导的多目标跟踪
计算机视觉与模式识别
2024-06-13 v1
摘要
视觉语言多目标跟踪 (Vision-Language MOT) 是一个关键的跟踪问题,近年来受到广泛关注。它旨在基于人类语言命令进行目标跟踪,取代传统跟踪任务中依赖模板或训练集中预设信息的做法。尽管已有多项努力,但关键挑战在于缺乏对语言用于跟踪的明确理解,这会阻碍该领域的进一步发展。本文通过引入语言引导的多目标跟踪 (Language-Guided MOT),构建了一个统一的任务框架,并提出了相应的大规模基准数据集,称为 LaMOT,涵盖多种场景和语言描述。 LaMOT 包含来自 4 个不同数据集的 1,660 个序列,旨在统一各种视觉语言多目标跟踪任务,同时提供标准化的评估平台。为确保高质量标注,我们为每个视频中的每个目标手动分配合适的描述性文本,并进行仔细检查和校正。据我们所知,LaMOT 是首个专注于语言引导多目标跟踪的数据集。此外,我们提出了简单而有效的跟踪器,称为 LaMOTer。通过建立统一的任务框架、提供具有挑战性的基准数据集,并为未来算法设计和评估提供见解,我们期望为视觉语言多目标跟踪领域的研究进步作出贡献。我们将在 https://github.com/Nathan-Li123/LaMOT 上发布数据。
引用
@article{arxiv.2406.08324,
title = {LaMOT: Language-Guided Multi-Object Tracking},
author = {Yunhao Li and Xiaoqiong Liu and Luke Liu and Heng Fan and Libo Zhang},
journal= {arXiv preprint arXiv:2406.08324},
year = {2024}
}