中文

GGRt:迈向实时无位姿可泛化的 3D Gaussian Splatting

计算机视觉与模式识别 2024-05-13 v2

摘要

本文提出了 GGRt,一种新颖的可泛化新视角合成方法,该方法免除了对真实相机位姿的需求、处理高分辨率图像的复杂性以及漫长的优化过程,从而促进了 3D Gaussian Splatting(3D-GS)在实际场景中的更强适用性。具体而言,我们设计了一种新颖的联合学习框架,由迭代位姿优化网络(IPO-Net)和可泛化 3D-Gaussians(G-3DG)模型组成。借助联合学习机制,所提出的框架能够从图像观测中内在地估计稳健的相对位姿信息,从而主要缓解了对真实相机位姿的要求。此外,我们实现了延迟反向传播机制,支持高分辨率训练和推理,克服了以往方法的分辨率限制。为了提高速度和效率,我们进一步引入了一个渐进式高斯缓存模块,该模块在训练和推理过程中进行动态调整。作为首个无位姿可泛化 3D-GS 框架,GGRt 实现了 \ge 5 FPS 的推理和 \ge 100 FPS 的实时渲染。通过大量实验,我们证明了我们的方法在推理速度和有效性方面优于现有的基于 NeRF 的无位姿技术。它也能逼近基于真实位姿的 3D-GS 方法。我们的贡献为计算机视觉与计算机图形学融入实际应用迈出了重要一步,在 LLFF、KITTI 和 Waymo Open 数据集上提供了 SOTA 的结果,并支持沉浸式体验的实时渲染。

关键词

引用

@article{arxiv.2403.10147,
  title  = {GGRt: Towards Pose-free Generalizable 3D Gaussian Splatting in Real-time},
  author = {Hao Li and Yuanyuan Gao and Chenming Wu and Dingwen Zhang and Yalun Dai and Chen Zhao and Haocheng Feng and Errui Ding and Jingdong Wang and Junwei Han},
  journal= {arXiv preprint arXiv:2403.10147},
  year   = {2024}
}

备注

Project page: https://3d-aigc.github.io/GGRt