中文

Spatia:基于可更新空间记忆的视频生成

计算机视觉与模式识别 2025-12-18 v1 人工智能

摘要

现有视频生成模型因视频信号的稠密高维特性,难以维持长期的空间与时间一致性。为克服这一限制,我们提出了 Spatia—a一种具备空间记忆感知能力的视频生成框架,通过显式保留作为持久空间记忆的3D场景点云来实现。Spatia 在该空间记忆上进行条件生成,迭代式地生成视频片段,并通过视觉SLAM持续更新空间记忆。这种动态-静态解耦设计在生成过程中增强了空间一致性,同时保留了模型生成真实动态实体的能力。此外,Spatia 支持明确的相机控制和3D感知交互编辑等应用,为可扩展的、以记忆为驱动的视频生成提供了几何学上严谨的框架。

关键词

引用

@article{arxiv.2512.15716,
  title  = {Spatia: Video Generation with Updatable Spatial Memory},
  author = {Jinjing Zhao and Fangyun Wei and Zhening Liu and Hongyang Zhang and Chang Xu and Yan Lu},
  journal= {arXiv preprint arXiv:2512.15716},
  year   = {2025}
}

备注

Project page: https://zhaojingjing713.github.io/Spatia/