DRMOT:面向RGBD指涉式多目标跟踪的数据集与框架
计算机视觉与模式识别
2026-02-09 v2 人工智能
摘要
指涉式多目标跟踪(RMOT)旨在基于语言描述跟踪特定目标,对于机器人和自动驾驶等交互式AI系统至关重要。然而,现有RMOT模型仅依赖2D RGB数据,难以准确检测和关联由复杂空间语义(如“最近的摄像机的人员”)特征化的目标,以及在严重遮挡时维持可靠身份标识。为此,本文提出了一种新任务,RGBD指涉式多目标跟踪(DRMOT),该任务显式要求模型融合RGB、深度(D)和语言(L)三种模态以实现3D感知跟踪。为推动DRMOT任务的研究,我们构建了一个量身定制的RGBD指涉式多目标跟踪数据集,命名为DRSet,旨在评估模型的空间语义定位和跟踪能力。具体而言,DRSet包含来自187个场景的RGB图像和深度图,以及240条语言描述,其中56条描述包含与深度相关的信息。此外,我们提出了DRTrack,一个由MLLM引导的深度指涉跟踪框架。DRTrack通过融合RGB-D-L输入实现深度感知目标定位,并通过深度线索强化轨迹关联。在DRSet数据集上的大量实验表明,我们的框架有效。
引用
@article{arxiv.2602.04692,
title = {DRMOT: A Dataset and Framework for RGBD Referring Multi-Object Tracking},
author = {Sijia Chen and Lijuan Ma and Yanqiu Yu and En Yu and Liman Liu and Wenbing Tao},
journal= {arXiv preprint arXiv:2602.04692},
year = {2026}
}
备注
https://github.com/chen-si-jia/DRMOT