中文

基于多模态大型语言模型的视觉-运动-参考对齐用于指涉式多目标跟踪

计算机视觉与模式识别 2025-11-25 v1

摘要

指涉式多目标跟踪(RMOT)扩展了传统的多目标跟踪(MOT),通过引入自然语言参考实现多模态融合跟踪。RMOT基准仅描述目标的外观、相对位置和初始运动状态。这种所谓的静态调节未能捕捉目标运动的动态变化,包括速度变化和运动方向转移。这种限制不仅导致静态参考与动态视觉模态之间存在时间差异,还限制了多模态跟踪性能。为解决这一限制,我们提出了一种新颖的视觉-运动-参考对齐RMOT框架,命名为VMRMOT。它将从目标动态中提取的运动模态集成到通过多模态大型语言模型(MLLM)增强视觉模态与语言参考之间的对齐。具体而言,我们引入由目标动态行为派生的运动感知描述,并利用 MLLM 的强大时序推理能力提取运动特征作为运动模态。我们进一步设计了视觉-运动-参考对齐(VMRA)模块,以层次方式对齐视觉查询与运动和参考线索,增强它们的跨模态一致性。此外,我们开发了运动引导的预测头(MGPH),以探索运动模态来增强预测头的性能。据我们所知,VMRMOT 是首个在RMOT任务中运用 MLLM 实现视觉-参考对齐的方法。在多个RMOT基准上的大量实验表明,VMRMOT 优于现有的领先方法。

关键词

引用

@article{arxiv.2511.17681,
  title  = {Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Language Models},
  author = {Weiyi Lv and Ning Zhang and Hanyang Sun and Haoran Jiang and Kai Zhao and Jing Xiao and Dan Zeng},
  journal= {arXiv preprint arXiv:2511.17681},
  year   = {2025}
}