中文

PixFoundation 2.0:视频多模态 LLM 是否在视觉定位中使用运动信息?

计算机视觉与模式识别 2025-09-04 v1

摘要

多模态大语言模型(MLLM)在使用图像和文本模态的任务上展现出惊人的泛化能力。虽然其对视频的扩展已使视频问答和视频描述等任务成为可能,但其像素级视觉定位能力尚未得到充分研究。本文提出了一个关键性问题:运动是否被用于像素级视觉定位,视频 MLLM 是否能基于描述其运动模式的自然语言表达式对对象进行分割?我们指出当前基准测试的不足,展示了单帧往往足以捕捉运动指代表达,无需进行时序推理。为此,我们引入四种针对视觉定位任务专门设计的运动中心探测技术,来研究视频 MLLM 识别真实运动与伪造运动的能力,以及把握运动顺序的能力。因此,我们提供了一个运动中心基准测试,MoCentric-Bench。它确保视频 MLLM 的评估侧重于运动与语言交互,而非受现有视觉定位数据集中强调的静态外观线索的主导。我们进一步建立了强大的单图像基线,与先前方法相当或更优。最后,我们探索了简单的运动中心适应技术,实现了在 MoCentric-Bench 上的最新性能。我们的运动中心基准、评估方法和发现挑战未来模型在视频中实现稠密时空定位和像素级理解。代码和数据集将在 https://github.com/MSiam/PixFoundation-2.0.git 公开。

关键词

引用

@article{arxiv.2509.02807,
  title  = {PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?},
  author = {Mennatullah Siam},
  journal= {arXiv preprint arXiv:2509.02807},
  year   = {2025}
}

备注

Work under review in NeurIPS 2025 with the title "Are we using Motion in Referring Segmentation? A Motion-Centric Evaluation"