基于 LLaVA-Video 的多目标跟踪检索:面向 MOT25-StAG 挑战的无训练解决方案
计算机视觉与模式识别
2025-11-06 v1
摘要
本报告我们呈现了对 MOT25-Spatiotemporal Action Grounding(MOT25-StAG)挑战的解决方案。该挑战的目标是使用来自复杂真实场景的视频数据,准确定位并跟踪与特定且自由形式语言查询相匹配的多个对象。我们将该任务建模为视频检索问题,提出了两阶段零样本方法,结合了 SOTA 跟踪模型 FastTracker 和多模态大语言模型 LLaVA-Video 的优势。在 MOT25-StAG 测试集上,我们的方法实现了 m-HIoU 和 HOTA 分数分别为 20.68 和 10.73,位列榜单第二名。
引用
@article{arxiv.2511.03332,
title = {Multi-Object Tracking Retrieval with LLaVA-Video: A Training-Free Solution to MOT25-StAG Challenge},
author = {Yi Yang and Yiming Xu and Timo Kaiser and Hao Cheng and Bodo Rosenhahn and Michael Ying Yang},
journal= {arXiv preprint arXiv:2511.03332},
year = {2025}
}