中文

MOSE:利用 NeRF 提升的噪声先验进行单目语义重建

计算机视觉与模式识别 2024-09-24 v1 人工智能 机器人学

摘要

由于缺乏几何引导和不完美的视点相关 2D 先验,从单目图像中准确重建密集且带有语义标注的 3D 网格仍然是一项具有挑战性的任务。尽管我们见证了隐式神经场景表示的最新进展,这些进展仅从多视图图像就能实现精确的 2D 渲染,但仅利用单目先验来解决 3D 场景理解的工作仍然很少。在本文中,我们提出了一种神经场语义重建方法 MOSE,将推断出的图像级噪声先验提升到 3D,在 3D 和 2D 空间中产生准确的语义和几何。我们方法的关键动机是利用通用的类无关分割掩码作为引导,以促进训练期间渲染语义的局部一致性。借助语义,我们进一步对无纹理区域应用平滑正则化以获得更好的几何质量,从而实现几何与语义的互利。在 ScanNet 数据集上的实验表明,我们的 MOSE 在 3D 语义分割、2D 语义分割和 3D 表面重建任务的所有指标上均优于相关基线。

关键词

引用

@article{arxiv.2409.14019,
  title  = {MOSE: Monocular Semantic Reconstruction Using NeRF-Lifted Noisy Priors},
  author = {Zhenhua Du and Binbin Xu and Haoyu Zhang and Kai Huo and Shuaifeng Zhi},
  journal= {arXiv preprint arXiv:2409.14019},
  year   = {2024}
}

备注

8 pages, 10 figures