中文

大规模单目3D重建的深度、姿态与局部辐射场联合学习

计算机视觉与模式识别 2026-02-02 v2 机器人学

摘要

单目视频的全景3D重建在深度、姿态和辐射分离求解时在大规模场景中会失败:尺度模糊的深度导致幽灵几何,长程姿态漂移破坏对齐,单个全局NeRF无法建模数百米的内容。我们引入一种联合学习框架,将这三个因素耦合在一起,显著克服了每个故障案例。我们的系统以Vision-Transformer(ViT)深度网络启动,采用度量尺度监督训练,实现全球一致的深度,尽管视场范围差异很大。多尺度特征bundle-adjustment(BA)层直接在特征空间中细化相机姿态——利用所学的金字塔描述符而非脆弱的关键点——以抑制不受约束轨迹上的漂移。对于场景表示,我们部署递增的局部辐射场层次结构:当视角重叠度低于阈值时,便会分配并冻结新的哈希网格NeRF,以实现单张GPU上的街区级覆盖。我们在Tanks and Temples基准测试中评估了该方法,使绝对轨迹误差降至0.001-0.021米(相对于BARF低至18倍,相对于NoPe-NeRF低至2倍),同时保持亚像素级相对姿态误差。这些结果表明,从单台未校准的RGB相机即可实现尺度感知、漂移自由的3D重建和高保真新视角合成是可行的。

关键词

引用

@article{arxiv.2512.18237,
  title  = {Joint Learning of Depth, Pose, and Local Radiance Field for Large Scale Monocular 3D Reconstruction},
  author = {Shahram Najam Syed and Yitian Hu and Yuchao Yao},
  journal= {arXiv preprint arXiv:2512.18237},
  year   = {2026}
}

备注

8 pages, 2 figures, 2 tables