基于深度增强扩散先验的姿态无关稀疏视图场景重建
计算机视觉与模式识别
2025-10-13 v3
摘要
本文提出一种生成方法,用于从稀疏二维图像集实现无姿态 (即无摄像机参数) 的 360 场景重建。姿态无关的稀疏观察场景重建通常通过深度估计或 3D 基础先验进行正则化。尽管近期进展使得使用已知摄像机姿态的稀疏视图大型复杂场景 (具有高度的前景和背景细节) 重建成为可能,但这些方法无法直接适用于姿态无关的情况,因为在评估期间没有可用的真实姿态。为此,我们提出一种面向 3D 场景深度图和新视角渲染中缺失细节的 inpainting 以及去除伪影的图像到图像生成模型。我们引入使用特征线性调制 (FiLM) 调制层作为轻量级的跨注意力替代方案,并提出一种 novel 置信度度量,用于更好地检测这些伪影。通过在高斯-SLAM 启发的过程中逐步整合这些新视角,我们实现了多视角一致的 3D 表示。在 MipNeRF360 和 DL3DV-10K 数据集上的评估表明,我们的方法在姿态无关技术方面超越了现有方法,并在复杂 360 场景中与最先进的带姿态 (即预计算摄像机参数) 重建方法保持竞争力。我们的项目页面提供了额外的结果、视频和代码。
引用
@article{arxiv.2411.15966,
title = {Gaussian Scenes: Pose-Free Sparse-View Scene Reconstruction using Depth-Enhanced Diffusion Priors},
author = {Soumava Paul and Prakhar Kaushik and Alan Yuille},
journal= {arXiv preprint arXiv:2411.15966},
year = {2025}
}
备注
Accepted to TMLR 2025. Code and models released at https://gaussianscenes.github.io/