中文

无姿态图像的大规模新视角合成即时重建

计算机视觉与模式识别 2025-06-09 v1

摘要

辐射场方法如 3D 高斯溶解(3DGS)允许从照片中轻松重建,实现自由视角导航。然而,采用结构从运动(Structure from Motion)和 3DGS 优化的姿态估计,仍需数分钟至数小时的计算时间。SLAM 方法结合 3DGS 速度快,但在宽摄像机基线和大场景方面仍存在挑战。我们提出一种即时方法,在捕获后即可生成相机姿态和训练好的 3DGS。该方法能够处理密集且基线宽的有序照片序列以及大规模场景。为实现此目标,我们首先引入快速初始姿态估计,利用学习特征和面向 GPU 的小型 bundle adjustment。随后,我们引入高斯原始位置和形状的直接采样,逐步在所需位置生成原始体,显著加速训练过程。这两个高效步骤允许对姿态和高斯原始体进行快速且稳健的联合优化。通过引入可扩展的辐射场构建,逐步聚类 3DGS 原始体,存储于锚点中,并从 GPU 中卸载,从而处理大规模场景。聚类后的原始体被逐步合并,保持任意视角下所需的 3DGS 规模。我们在多种数据集上进行评估,展示了本方法在速度、图像质量或两者兼顾方面,能够为我们所针对的所有捕获场景和场景规模提供即时处理,同时与仅能处理特定捕获方式或场景规模的方法保持竞争力。

关键词

引用

@article{arxiv.2506.05558,
  title  = {On-the-fly Reconstruction for Large-Scale Novel View Synthesis from Unposed Images},
  author = {Andreas Meuleman and Ishaan Shah and Alexandre Lanvin and Bernhard Kerbl and George Drettakis},
  journal= {arXiv preprint arXiv:2506.05558},
  year   = {2025}
}