中文

Molmo2:面向视频理解与定位的开源视觉语言模型

计算机视觉与模式识别 2026-04-03 v4 人工智能

摘要

当今最强大的视频语言模型(VLM)仍属专有模型。最强的开源权重模型要么依赖来自专有 VLM 的合成数据,实际上是从它们蒸馏得出,要么不披露其训练数据或配方。作为结果,开源社区缺乏提升视频(以及图像)语言模型性能的基础。关键的是,许多下游应用需要不仅仅是高层次的视频理解,还需要定位——即通过指向或像素级跟踪。即便是专有模型也缺乏这一能力。我们提出 Molmo2,一套新的 VLM,虽为开源模型中最先进的水平,却在单图、多图和视频任务中展示了卓越的新能力,尤其在基于点的定位方面表现突出。我们的关键贡献是 7 套新的视频数据集和 2 套多图数据集,包括用于预训练的高度详细视频字幕数据集、用于微调的自由形式视频问答数据集、一个具有复杂查询的新型对象跟踪数据集,以及一个创新的视频指向数据集,所有数据均未使用封闭 VLM 收集。我们还提出了该数据的训练配方,采用高效打包和消息树编码方案,展示了对视觉标记和新颖标记权重策略的双向注意力可提升性能。我们最佳 8B 模型在短视频、计数和字幕任务中超越了同类开源权重和数据模型,在长视频上表现具有竞争力。在视频定位任务中,Molmo2 在开源权重模型如 Qwen3-VL(视频计数准确率 29.6% vs 35.5%)和专有模型如 Gemini 3 Pro(视频指向 F1 38.4% vs 20.0%,视频跟踪 J&F 56.2% vs 41.1%)上均显著超越表现。

关键词

引用

@article{arxiv.2601.10611,
  title  = {Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding},
  author = {Christopher Clark and Jieyu Zhang and Zixian Ma and Jae Sung Park and Mohammadreza Salehi and Rohun Tripathi and Sangho Lee and Zhongzheng Ren and Chris Dongjoo Kim and Yinuo Yang and Vincent Shao and Yue Yang and Weikai Huang and Ziqi Gao and Taira Anderson and Jianrui Zhang and Jitesh Jain and George Stoica and Winson Han and Ali Farhadi and Ranjay Krishna},
  journal= {arXiv preprint arXiv:2601.10611},
  year   = {2026}
}

备注

Updated first authors