中文

NeSF:用于3D场景可泛化语义分割的神经语义场

计算机视觉与模式识别 2021-12-06 v3 机器人学

摘要

我们提出 NeSF,一种仅从带位姿的 RGB 图像生成 3D 语义场的方法。我们的方法摒弃经典 3D 表示,建立在隐式神经场景表示的最新工作之上,其中 3D 结构由逐点函数捕获。我们利用该方法恢复 3D 密度场,随后在其上训练一个由带位姿的 2D 语义图监督的 3D 语义分割模型。尽管仅在 2D 信号上训练,我们的方法能够从新相机位姿生成 3D 一致的语义图,并可在任意 3D 点处查询。值得注意的是,NeSF 与任何生成密度场的方法兼容,且其精度随密度场质量的提高而提升。我们的实证分析表明,在复杂、真实感渲染的合成场景上,其质量可与有竞争力的 2D 和 3D 语义分割基线相媲美。我们的方法是首个仅需 2D 监督进行训练即可提供真正稠密 3D 场景分割的方法,且在新场景推理时不需要任何语义输入。我们鼓励读者访问项目网站。

关键词

引用

@article{arxiv.2111.13260,
  title  = {NeSF: Neural Semantic Fields for Generalizable Semantic Segmentation of 3D Scenes},
  author = {Suhani Vora and Noha Radwan and Klaus Greff and Henning Meyer and Kyle Genova and Mehdi S. M. Sajjadi and Etienne Pot and Andrea Tagliasacchi and Daniel Duckworth},
  journal= {arXiv preprint arXiv:2111.13260},
  year   = {2021}
}

备注

Project website: https://nesf3d.github.io/. Updated with minor edits to text