中文

SpatialCrafter:释放视频扩散模型在稀疏观察场景重建中的想象力

计算机视觉与模式识别 2025-07-14 v2

摘要

新视角合成 (NVS) 为计算机视觉和图形学中的沉浸式体验提供了动力。虽然现有技术已有所进展,但它们依赖稠密多视角观察,限制了其应用。本 work 旨在从稀疏或单视图输入重建出逼真的 3D 场景。我们引入 SpatialCrafter 框架,利用视频扩散模型中丰富的知识生成合理的额外观察,从而缓解重建歧义。通过可训练的相机编码器和用于显式几何约束的三角形注意力机制,我们实现了精确的相机控制和 3D 一致性,并通过统一的尺度估计策略处理跨数据集的尺度差异。此外,通过将单眼深度先验与语义特征在视频潜在空间中集成,我们的框架直接回归 3D 高斯原始点,并使用混合网络结构高效处理长序列特征。广泛的实验表明,我们的方法增强了稀疏视图重建并恢复了 3D 场景的真实外观。

关键词

引用

@article{arxiv.2505.11992,
  title  = {SpatialCrafter: Unleashing the Imagination of Video Diffusion Models for Scene Reconstruction from Limited Observations},
  author = {Songchun Zhang and Huiyao Xu and Sitong Guo and Zhongwei Xie and Hujun Bao and Weiwei Xu and Changqing Zou},
  journal= {arXiv preprint arXiv:2505.11992},
  year   = {2025}
}

备注

Accepted by ICCV 2025. 12 pages, 9 figures