中文

单摄像机视频中神经辐射场与连续相机运动的联合优化

计算机视觉与模式识别 2025-04-29 v1

摘要

神经辐射场(NeRF)已展示其在表示 3D 几何方面的优越能力,但需要在训练期间准确预计算相机姿态。为缓解这一要求,现有方法联合优化相机姿态和 NeRF,往往依赖良好的姿态初始值或深度先验。然而,这些方法在大旋转等具挑战性情景下难以处理,因为它们将每个相机映射到世界坐标系中。我们提出一种新方法,通过建模连续相机运动为时间依赖的角速度和速度来消除先验依赖。首先通过速度积分学习相机之间的相对运动,随后通过聚合这些相对运动(以单个时间步骤内定义的世界坐标系为基准)获取相机姿态。具体而言,通过时间依赖的 NeRF 学习准确的连续相机运动,该 NeRF 从每个时间步骤的相邻帧进行训练,捕获局部场景几何和运动。所学到的运动使我们能够微调 NeRF 以表示整个场景的几何。在 Co3D 和 Scannet 上的实验表明,我们的方法在相机姿态和深度估计方面优于最新方法,同时在新视角合成方面表现与 SOTA 方法相当。我们的代码可在 https://github.com/HoangChuongNguyen/cope-nerf 获取。

关键词

引用

@article{arxiv.2504.19819,
  title  = {Joint Optimization of Neural Radiance Fields and Continuous Camera Motion from a Monocular Video},
  author = {Hoang Chuong Nguyen and Wei Mao and Jose M. Alvarez and Miaomiao Liu},
  journal= {arXiv preprint arXiv:2504.19819},
  year   = {2025}
}