中文

FoundationMotion:视频中空间运动的自动标注与推理

计算机视觉与模式识别 2025-12-12 v1

摘要

运动理解是物理推理的基础,使模型能够推断动力学并预测未来状态。然而,由于缺乏大规模、细粒度的运动数据集,最先进的模型在最近的运动基准测试上仍然举步维艰。现有的运动数据集通常构建自昂贵的人工标注,严重限制了可扩展性。为了应对这一挑战,我们引入了 FoundationMotion,这是一个构建大规模运动数据集的全自动化数据处理流水线。我们的方法首先检测并跟踪视频中的物体以提取其轨迹,然后利用这些轨迹和视频帧结合大语言模型(LLMs)生成关于运动和空间推理的细粒度描述和多样化的问答对。使用该流水线生成的数据集,我们微调了包括 NVILA-Video-15B 和 Qwen2.5-7B 在内的开源模型,在不影响其他任务性能的情况下,在运动理解方面取得了显著提升。值得注意的是,我们的模型在多样化的运动理解数据集和基准测试中,表现优于 Gemini-2.5 Flash 等强大的闭源基线模型以及 Qwen2.5-VL-72B 等大型开源模型。因此,FoundationMotion 为策划细粒度运动数据集提供了一个可扩展的解决方案,该方案能够对多样化模型进行有效微调,以增强运动理解和空间推理能力。

关键词

引用

@article{arxiv.2512.10927,
  title  = {FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos},
  author = {Yulu Gan and Ligeng Zhu and Dandan Shan and Baifeng Shi and Hongxu Yin and Boris Ivanovic and Song Han and Trevor Darrell and Jitendra Malik and Marco Pavone and Boyi Li},
  journal= {arXiv preprint arXiv:2512.10927},
  year   = {2025}
}

备注

Code is available at https://github.com/Wolfv0/FoundationMotion/tree/main