中文

LLMTrack:基于多模态大语言模型的语义多目标跟踪

计算机视觉与模式识别 2026-03-13 v2 人工智能

摘要

多目标跟踪 (Multi-Object Tracking, MOT) 正在从几何定位向语义多目标跟踪 (Semantic MOT, SMOT) 演进,以回答复杂的关系查询,但由于语义数据稀缺以及跟踪架构与多模态大语言模型 (MLLMs) 之间的结构性断裂,进展受到阻碍。为此,我们引入 Grand-SMOT,一个大规模、开放世界基准,提供高密度、双流叙事,全面地解耦个体行为与环境背景。此外,我们提出 LLMTrack,首个无缝集成 MLLMs 以实现 SMOT 任务的框架。LLMTrack 建立在以宏观理解为先的范式中,利用一种新颖的时空融合模块,将离散的几何轨迹与连续的语义特征对齐,从而有效抑制在在线处理期间的时序幻觉。广泛的实验表明,LLMTrack 在实现最先进的几何跟踪性能的同时,还实现了对动态语义推理的质的飞跃。值得注意的是,我们的分析揭示,高质量的语义叙事使语言模型能够自然地推导复杂的社交互动,表明直接的认知推理比笨拙的显式视觉建模更有效。最终,我们的贡献弥合了感知跟踪与认知推理之间的鸿沟,为全面视频理解和智能叙事生成奠定了稳健的新基础。

关键词

引用

@article{arxiv.2601.06550,
  title  = {LLMTrack: Semantic Multi-Object Tracking with Multi-modal Large Language Models},
  author = {Pan Liao and Feng Yang and Di Wu and Jinwen Yu and Yuhua Zhu and Wenhui Zhao and Dingwen Zhang},
  journal= {arXiv preprint arXiv:2601.06550},
  year   = {2026}
}