ORMOT:用于全向指涉式多目标跟踪的数据集和框架
计算机视觉与模式识别
2026-03-06 v1
摘要
多目标跟踪 (MOT) 是计算机视觉中的一个基本任务,旨在跟踪跨视频帧的目标。现有的 MOT 方法在一般视觉场景中表现良好,但在扩展到视觉语言设置时面临诸多挑战和局限。为弥合这一差距,最近提出了指涉式多目标跟踪 (RMOT) 任务,该任务旨在跟踪对应语言描述的对象。然而,当前的 RMOT 方法主要是在由常规摄像机捕获的数据集上开发的,这些数据集受限于视场范围,常导致目标移出画面,引起跟踪碎片化和信息丢失。本文提出了一种新任务,称为全向指涉式多目标跟踪 (ORMOT),将 RMOT 扩展到全向图像,以克服常规数据集的视场范围限制,并提高模型理解长程语言描述的能力。为推进 ORMOT 任务,我们构建了 ORSet,即全向指涉式多目标跟踪数据集,包含 27 个多样化的全向场景、848 条语言描述和 3,401 条标注目标,提供丰富的视觉、时序和语言信息。此外,我们提出了 ORTrack,一个针对全向指涉式多目标跟踪的大型视觉语言模型 (LVLM) 驱动框架。在 ORSet 数据集上进行的大量实验表明,我们的 ORTrack 框架有效。该数据集和代码将在 https://github.com/chen-si-jia/ORMOT 开源。
引用
@article{arxiv.2603.05384,
title = {ORMOT: A Dataset and Framework for Omnidirectional Referring Multi-Object Tracking},
author = {Sijia Chen and Zihan Zhou and Yanqiu Yu and En Yu and Wenbing Tao},
journal= {arXiv preprint arXiv:2603.05384},
year = {2026}
}
备注
https://github.com/chen-si-jia/ORMOT