中文

Motion-o:基于轨迹的视频推理

计算机视觉与模式识别 2026-05-11 v2 人工智能

摘要

近期的视频推理模型越来越多地产生在特定时间戳局部化物体的时空证据链。虽然这些轨迹通过 grounding 实证了 where and when 证据出现,但往往隐含了连接观察的运动,即 how。这使得动态且依赖轨迹的论断难以监督、验证或在缺乏视频支持时进行惩罚。我们将这一缺失组件形式化为时空-轨迹 (STT) 推理,提出Motion-o,一种以运动为中心的视觉语言模型 (VLM) 扩展,通过使轨迹显式化和可验证来实现这一目标。Motion-o 通过 Motion Chain of Thought (MCoT),一种结构化路径表示物体运动的离散 <motion/> 标签,概括方向、速度和尺度变化。为监督MCoT,我们将稀疏时空注释密集化为物体轨迹,并从中心位移和框面积变化中推导运动描述。随后,我们通过轨迹一致性和视觉 grounding 的补充奖励进行训练,包括一种基于扰动的信号,当时空证据被移除时惩罚不变的运动描述。跨多个视频理解基准测试,Motion-o consistently 提升了轨迹忠实推理,却无需架构修改。这些结果表明,显式的运动界面可以补充现有VLM管道,通过将隐式动力学转换为可验证证据。代码已于 GitHub 提供:ostadabbas/Motion-o。

关键词

引用

@article{arxiv.2603.18856,
  title  = {Motion-o: Trajectory-Grounded Video Reasoning},
  author = {Bishoy Galoaa and Shayda Moezzi and Xiangyu Bai and Sarah Ostadabbas},
  journal= {arXiv preprint arXiv:2603.18856},
  year   = {2026}
}