MOSE:利用 NeRF 提升的噪声先验进行单目语义重建
计算机视觉与模式识别
2024-09-24 v1 人工智能
机器人学
摘要
由于缺乏几何引导和不完美的视点相关 2D 先验,从单目图像中准确重建密集且带有语义标注的 3D 网格仍然是一项具有挑战性的任务。尽管我们见证了隐式神经场景表示的最新进展,这些进展仅从多视图图像就能实现精确的 2D 渲染,但仅利用单目先验来解决 3D 场景理解的工作仍然很少。在本文中,我们提出了一种神经场语义重建方法 MOSE,将推断出的图像级噪声先验提升到 3D,在 3D 和 2D 空间中产生准确的语义和几何。我们方法的关键动机是利用通用的类无关分割掩码作为引导,以促进训练期间渲染语义的局部一致性。借助语义,我们进一步对无纹理区域应用平滑正则化以获得更好的几何质量,从而实现几何与语义的互利。在 ScanNet 数据集上的实验表明,我们的 MOSE 在 3D 语义分割、2D 语义分割和 3D 表面重建任务的所有指标上均优于相关基线。
引用
@article{arxiv.2409.14019,
title = {MOSE: Monocular Semantic Reconstruction Using NeRF-Lifted Noisy Priors},
author = {Zhenhua Du and Binbin Xu and Haoyu Zhang and Kai Huo and Shuaifeng Zhi},
journal= {arXiv preprint arXiv:2409.14019},
year = {2024}
}
备注
8 pages, 10 figures