中文

STORM:视频中端到端指涉多目标跟踪

计算机视觉与模式识别 2026-04-14 v1 人工智能

摘要

指涉多目标跟踪(RMOT)是将视频中与给定文本查询或指涉表达式语义匹配的所有对象关联起来的任务。现有 RMOT 方法将对象定位和跟踪分解为独立模块,由于训练视频稀缺、注释模糊和受限领域,表现有限。本文提出 STORM,一个端到端的 MLLM,联合执行定位和跟踪于统一框架内,消除外部检测器,实现对外观、运动和语言的连贯推理。为提高数据效率,我们提出了任务组成学习(TCL)策略,将 RMOT 分解为图像定位和对象跟踪,使 STORM 能够利用数据丰富的子任务并学习结构化的时空推理。我们进一步构建了 STORM-Bench,一个新的 RMOT 数据集,包含准确的轨迹和通过底层注释管道生成的多样且无歧义的指涉表达式。大量实验表明,STORM 在图像定位、单目标跟踪和 RMOT 基准测试上实现了最先进的性能,显示出强大的泛化能力和在复杂真实场景中的稳健时空定位。STORM-Bench 将在 https://github.com/amazon-science/storm-referring-multi-object-grounding 发布。

关键词

引用

@article{arxiv.2604.10527,
  title  = {STORM: End-to-End Referring Multi-Object Tracking in Videos},
  author = {Zijia Lu and Jingru Yi and Jue Wang and Yuxiao Chen and Junwen Chen and Xinyu Li and Davide Modolo},
  journal= {arXiv preprint arXiv:2604.10527},
  year   = {2026}
}

备注

CVPR 2026 Findings