中文

Video4Spatial: 迈向基于上下文引导视频生成的视觉空间智能

计算机视觉与模式识别 2025-12-12 v2 人工智能

摘要

我们研究了仅使用视觉数据,视频生成模型是否能够展现出视觉空间智能——这一对人类认知至关重要的能力。为此,我们提出了 Video4Spatial,一个展示视频扩散模型仅通过基于视频的场景上下文条件化即可执行复杂空间任务的框架。我们在两个任务上进行了验证:场景导航——在遵循相机姿态指令的同时保持与场景三维几何的一致性,以及目标定位——需要语义定位、指令遵循和规划。两个任务均仅使用视频输入,无需深度或姿态等辅助模态。通过框架设计和数据筛选中的简单而有效的选择,Video4Spatial 展示了来自视频上下文的强大空间理解能力:它端到端地规划导航路径并定位目标对象,在保持空间一致性的同时遵循相机姿态指令,并能泛化到长上下文和跨域环境。综合来看,这些结果推动了视频生成模型向通用视觉空间推理方向发展。

关键词

引用

@article{arxiv.2512.03040,
  title  = {Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation},
  author = {Zeqi Xiao and Yiwei Zhao and Lingxiao Li and Yushi Lan and Ning Yu and Rahul Garg and Roshni Cooper and Mohammad H. Taghavi and Xingang Pan},
  journal= {arXiv preprint arXiv:2512.03040},
  year   = {2025}
}

备注

Project page at https://xizaoqu.github.io/video4spatial/