SIMS-V:用于空间视频理解的仿真指令微调
计算机视觉与模式识别
2025-11-17 v2
摘要
尽管 multimodal language models 在高层次视频理解方面取得了显著进展,但它们在空间上跨越时间和空间的推理方面仍面临挑战。当前空间训练方法依赖真实世界视频数据,但获取具有精确空间标注的多样化影像仍是瓶颈。为缓解这一瓶颈,我们提出 SIMS-V——一个系统化的数据生成框架,利用 3D 仿真器的特权信息为 multimodal language models 创建富含空间信息的视频训练数据。通过该框架,我们系统性地进行消融实验,检验哪些仿真数据的属性能够驱动有效的真实世界迁移。我们识别出三类问题类别(度量测量、视角相关推理和时间跟踪)构成的最小集合最有效,尽管使用更少的问题类型,却超过了全面覆盖。这些见解使得训练高度有效:我们7B参数的视频大语言模型仅在2.5万个仿真示例上微调,即可超过更大的72B基线模型,在严格的真实世界空间推理基准测试中取得与专有模型相当的性能。我们的做法表现出稳健的泛化能力,在一般视频理解任务中保持性能,同时在具身和真实世界空间任务上实现显著提升。
引用
@article{arxiv.2511.04668,
title = {SIMS-V: Simulated Instruction-Tuning for Spatial Video Understanding},
author = {Ellis Brown and Arijit Ray and Ranjay Krishna and Ross Girshick and Rob Fergus and Saining Xie},
journal= {arXiv preprint arXiv:2511.04668},
year = {2025}
}
备注
Project page: https://ellisbrown.github.io/sims-v