中文

基于视觉语言模型的训练-free 语义多目标跟踪

计算机视觉与模式识别 2026-04-16 v1

摘要

语义多目标跟踪(SMOT)扩展了多目标跟踪,引入语义输出,如视频摘要、实例级描述和交互标签,旨在从轨迹转向对动态场景的人类可解释描述。现有的 SMOT 系统需要端到端训练,依赖高成本的监督信息,限制了快速适应新基础模型和新交互方式的能力。我们提出了 TF-SMOT,一个训练-free 的 SMOT 流水线,通过组合预训练组件实现检测、基于掩码的跟踪和视频语言生成。TF-SMOT 组合 D-FINE 和可提示的 SAM2 分割跟踪器,生成具有时序一致性的 tracklet,使用轮廓 grounding 结合 InternVideo2.5 生成视频摘要和实例描述,并通过 LLM 语义消歧将提取的交互谓词与 BenSMOT WordNet 同位词对齐。在 BenSMOT 上,TF-SMOT 在 SMOT 设置下实现了最新的跟踪性能,并在摘要和描述质量方面优于现有方法。然而,在严格的精确匹配评估下,交互识别仍然具有挑战性,因为 WordNet 标签空间细粒度且标签分布长尾;我们的分析和消融研究表明,语义重叠和标签粒度对测量的性能有显著影响。

关键词

引用

@article{arxiv.2604.14074,
  title  = {Training-Free Semantic Multi-Object Tracking with Vision-Language Models},
  author = {Laurence Bonat and Francesco Tonini and Elisa Ricci and Lorenzo Vaquero},
  journal= {arXiv preprint arXiv:2604.14074},
  year   = {2026}
}

备注

Accepted to the 20th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2026)