中文

无姿态,无问题:从稀疏未定位图像构建3D高斯溅射

计算机视觉与模式识别 2024-11-01 v1

摘要

我们提出NoPoSplat,一个能够从*未定位*稀疏多视图图像中重构参数化为3D高斯的3D场景的 feed-forward 模型。该模型仅使用光度损失训练,能够在推理期间实现实时3D高斯重建。为消除重建过程中对准确姿态输入的需求,我们将一个输入视图的局部相机坐标锚定为标准空间,并训练网络在该空间内预测所有视图的高斯原始。这种做法消除了将高斯原始从局部坐标转换到全局坐标系统的需求,从而避免了每帧高斯和姿态估计相关的错误。为解决尺度歧义,我们设计并比较了各种内在嵌入方法,最终决定将相机内参转换为 token 嵌入并与图像 token 拼接作为模型的输入,从而实现准确的场景尺度预测。我们利用重建的3D高斯进行新视角合成和姿态估计任务,并提出了一种基于粗到细的两阶段管线,用于准确的姿态估计。实验结果表明,我们的姿态-free 方法在新视角合成质量方面优于需要姿态的方法,尤其是在输入图像重叠度有限的场景中表现突出。对于姿态估计,本方法在没有地面实深度或显式匹配损失的情况下训练,显著优于最先进的方法,提升显著。该工作在姿态-free 可泛化3D重建方面取得了重要进展,并展示了其在实际场景中的应用。代码和训练好的模型可访问于https://noposplat.github.io/。

关键词

引用

@article{arxiv.2410.24207,
  title  = {No Pose, No Problem: Surprisingly Simple 3D Gaussian Splats from Sparse Unposed Images},
  author = {Botao Ye and Sifei Liu and Haofei Xu and Xueting Li and Marc Pollefeys and Ming-Hsuan Yang and Songyou Peng},
  journal= {arXiv preprint arXiv:2410.24207},
  year   = {2024}
}

备注

Project page: https://noposplat.github.io/