中文

VideoMolmo:时空定位遇准点

计算机视觉与模式识别 2025-07-08 v2

摘要

时空局部化对于精准交互至关重要,涵盖从生物学研究到自动导航和交互界面等多个领域。当前的视频方法虽擅长跟踪,但缺乏大语言模型的复杂推理能力,限制了其上下文理解和泛化能力。我们引入 VideoMolmo,一个专为基于文本描述进行细粒度时空指向而设计的大型多模态模型。基于 Molmo 架构,VideoMolmo 集成了利用注意力机制的时序模块,以便条件化每帧相对于前几帧的内容,确保时序一致性。此外,我们提出的新型时序掩码融合管道采用 SAM2 实现双向点传播,显著提升视频序列中的连贯性。这种两步分解,即先使用 LLM 生成精确的指向坐标,再依赖顺序掩码融合模块生成连贯的分割,不仅简化了语言模型的任务,也增强了可解释性。由于缺乏合适的数据集,我们构建了一个包含 72k 视频-描述对、标注 100k 物体点的综合数据集。为评估 VideoMolmo 的泛化能力,我们引入 VPoS-Bench,这是一个横跨五个真实场景的挑战性离分布基准:细胞跟踪、环视视觉、自动驾驶、视频-GUI 交互和机器人。我们还在 Refer-VOS 和 Reasoning VOS 任务上对模型进行评估。与现有模型相比,VideoMolmo 在时空指向精度和推理能力方面显著提升。我们的模型和代码已公开于 https://github.com/mbzuai-oryx/VideoMolmo。

关键词

引用

@article{arxiv.2506.05336,
  title  = {VideoMolmo: Spatio-Temporal Grounding Meets Pointing},
  author = {Ghazi Shazan Ahmad and Ahmed Heakl and Hanan Gani and Abdelrahman Shaker and Zhiqiang Shen and Fahad Shahbaz Khan and Salman Khan},
  journal= {arXiv preprint arXiv:2506.05336},
  year   = {2025}
}

备注

20 pages, 13 figures