中文

以探测器为导引的视频大语言模型用于高效时空 grounding

计算机视觉与模式识别 2026-05-12 v2

摘要

多模态大语言模型(MLLM)正快速从一般视频理解扩展到更细粒度的理解,如时空视频 grounding(STVG)和推理。在这些任务中,MLLM必须在时空中定位用户查询的目标,并将结果作为推理依据。现有的MLLM方法主要遵循两种范式:(1)直接localization,通过额外的对齐模块或专用解码器输出STVG结果;(2)基于候选的selection,首先构建tube-level候选,然后通过MLLM选择相关候选。然而,两者都存在严重的效率瓶颈:前者随查询时空跨度增加而线性增长解码成本,后者依赖于高成本的候选构建。为突破这一瓶颈,我们提出DEViL(detector-empowered Video-LLM),其核心思想是将MLLM中密集的空间localization卸载到一个完全可并行、经过充分训练的探测器。具体而言,DEViL将查询蒸馏为探测器兼容的reference-semantic token,以取代探测器的文本嵌入,从而实现单次pass中的空间grounding。随后,我们设计了时序一致性正则化,以跨帧匹配物体并确保其在时序上的一致性。如此一来,DEViL避免了长坐标解码和重型候选管道。广泛的实验表明,DEViL在HC-STVG上实现了强大的性能(43.1% m_vIoU),同时具有卓越的效率(14.33 FPS),同时保持了MLLM backbone的通用推理能力。

关键词

引用

@article{arxiv.2512.06673,
  title  = {Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding},
  author = {Shida Gao and Feng Xue and Xiangfeng Wang and Anlong Ming and Zhaowen Lin and Haiyang Zhang and Teng Long and Nicu Sebe and Yihua Shao and Haozhe Wang and Wei Wang},
  journal= {arXiv preprint arXiv:2512.06673},
  year   = {2026}
}