中文

大规模场景中单目相机的深度、位姿与隐式场景表示的增量联合学习

计算机视觉与模式识别 2025-12-24 v3 机器人学

摘要

用于照片级视图合成的密集场景重建具有各种应用,例如 VR/AR 和自动驾驶。然而,由于三个核心挑战,大多数现有方法在大规模场景中面临困难:(a) 不准确的深度输入。在真实世界的大规模场景中无法获得准确的深度输入。(b) 不准确的位姿估计。大多数现有方法依赖于准确的预估计相机位姿。(c) 场景表示能力不足。单一全局辐射场缺乏有效扩展到大规模场景的能力。为此,我们提出了一种增量联合学习框架,可以实现准确的深度、位姿估计和大规模场景重建。采用基于 vision transformer 的网络作为主干网络,以增强尺度信息估计的性能。对于位姿估计,设计了一种特征度量束调整方法,用于在大规模场景中进行准确且鲁棒的相机追踪。在隐式场景表示方面,我们提出了一种增量场景表示方法,将整个大规模场景构建为多个局部辐射场,以增强 3D 场景表示的可扩展性。进行了广泛的实验以证明我们的方法在深度估计、位姿估计和大规模场景重建中的有效性和准确性。

关键词

引用

@article{arxiv.2404.06050,
  title  = {Incremental Joint Learning of Depth, Pose and Implicit Scene Representation on Monocular Camera in Large-scale Scenes},
  author = {Tianchen Deng and Nailin Wang and Chongdi Wang and Shenghai Yuan and Jingchuan Wang and Hesheng Wang and Danwei Wang and Weidong Chen},
  journal= {arXiv preprint arXiv:2404.06050},
  year   = {2025}
}