中文

引导式指代多目标跟踪

计算机视觉与模式识别 2025-10-28 v2 计算与语言

摘要

指代理解是一项基础任务,它通过定位自由形式表达中描述的对象来连接自然语言和视觉内容。然而,现有工作受限于有限的语言表达能力,缺乏对空间数量和时间状态中对象动态进行建模的能力。为了解决这些限制,我们引入了一项新的通用指代理解任务,称为指代多目标跟踪(RMOT)。其核心思想是利用语言表达作为语义线索来指导多目标跟踪的预测,全面考虑对象数量和时间语义的变化。伴随RMOT,我们引入了一个名为Refer-KITTI-V2的RMOT基准,具有可扩展和多样化的语言表达。为了高效生成覆盖对象动态的高质量标注,同时最小化人工工作量,我们提出了一种半自动标注流程,共制定了9,758个语言提示。此外,我们提出了TempRMOT,一个优雅的基于Transformer的端到端RMOT框架。其核心是查询驱动的时序增强模块,该模块将每个对象表示为一个Transformer查询,实现与其他对象和过去帧的长期时空交互,从而高效地优化这些查询。TempRMOT在Refer-KITTI和Refer-KITTI-V2上均达到了最先进的性能,证明了我们方法的有效性。源代码和数据集可在https://github.com/zyn213/TempRMOT获取。

关键词

引用

@article{arxiv.2406.05039,
  title  = {Bootstrapping Referring Multi-Object Tracking},
  author = {Yani Zhang and Dongming Wu and Wencheng Han and Xingping Dong},
  journal= {arXiv preprint arXiv:2406.05039},
  year   = {2025}
}