中文

DRMOT:面向RGBD指涉式多目标跟踪的数据集与框架

计算机视觉与模式识别 2026-02-09 v2 人工智能

摘要

指涉式多目标跟踪(RMOT)旨在基于语言描述跟踪特定目标,对于机器人和自动驾驶等交互式AI系统至关重要。然而,现有RMOT模型仅依赖2D RGB数据,难以准确检测和关联由复杂空间语义(如“最近的摄像机的人员”)特征化的目标,以及在严重遮挡时维持可靠身份标识。为此,本文提出了一种新任务,RGBD指涉式多目标跟踪(DRMOT),该任务显式要求模型融合RGB、深度(D)和语言(L)三种模态以实现3D感知跟踪。为推动DRMOT任务的研究,我们构建了一个量身定制的RGBD指涉式多目标跟踪数据集,命名为DRSet,旨在评估模型的空间语义定位和跟踪能力。具体而言,DRSet包含来自187个场景的RGB图像和深度图,以及240条语言描述,其中56条描述包含与深度相关的信息。此外,我们提出了DRTrack,一个由MLLM引导的深度指涉跟踪框架。DRTrack通过融合RGB-D-L输入实现深度感知目标定位,并通过深度线索强化轨迹关联。在DRSet数据集上的大量实验表明,我们的框架有效。

关键词

引用

@article{arxiv.2602.04692,
  title  = {DRMOT: A Dataset and Framework for RGBD Referring Multi-Object Tracking},
  author = {Sijia Chen and Lijuan Ma and Yanqiu Yu and En Yu and Liman Liu and Wenbing Tao},
  journal= {arXiv preprint arXiv:2602.04692},
  year   = {2026}
}

备注

https://github.com/chen-si-jia/DRMOT