中文

SpaceVLLM:为多模态大语言模型赋予时空视频定位能力

计算机视觉与模式识别 2025-04-14 v3

摘要

多模态大语言模型(MLLM)在单一维度上的时序或空间定位方面取得了显著进展,但在时空视频定位方面仍显吃力。这一局限性源于两个主要挑战:首先,难以准确提取视频每一帧的时空信息;其次,大量视觉 token 使得将每帧的视觉 token 精确映射到相应的空间坐标变得具有挑战性。为此,我们提出了 SpaceVLLM,一种具备时空视频定位能力的 MLLM。具体而言,我们采用交错的时空感知查询(Spatio-Temporal Aware Queries)来捕获时序感知和动态空间信息。此外,我们提出了查询引导的空间解码器(Query-Guided Space Decoder),以建立查询与空间坐标之间的对应关系。由于缺乏时空数据集,我们构建了统一时空定位数据集(Unified Spatio-Temporal Grounding, Uni-STG),包含 48 万个实例,覆盖三个任务。该数据集充分发挥了 MLLM 同时在时维和空维上进行定位的潜力。大量实验表明,SpaceVLLM 在覆盖时序、空间、时空及视频理解等 11 个基准上的表现居于最前,凸显了我们方法的有效性。我们的代码、数据集和模型将在 https://github.com/Jayce1kk/SpaceVLLM 上发布。

关键词

引用

@article{arxiv.2503.13983,
  title  = {SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability},
  author = {Jiankang Wang and Zhihan Zhang and Zhihang Liu and Yang Li and Jiannan Ge and Hongtao Xie and Yongdong Zhang},
  journal= {arXiv preprint arXiv:2503.13983},
  year   = {2025}
}