中文

GP-NeRF:用于上下文感知三维场景理解的广义感知神经辐射场

计算机视觉与模式识别 2024-04-09 v2

摘要

将NeRF应用于下游感知任务以进行场景理解与表示正日益流行。现有多数方法将语义预测视为额外的渲染任务,即“标签渲染”任务,以构建语义NeRF。然而,这些方法逐像素渲染语义/实例标签而不考虑渲染图像的上下文信息,通常存在边界分割不清和物体内像素异常分割的问题。为解决该问题,我们提出广义感知NeRF(GP-NeRF),一种使广泛使用的分割模型与NeRF在统一框架下兼容的新型流程,以促进上下文感知的三维场景感知。为实现此目标,我们引入transformers联合聚合辐射场与语义嵌入场以用于新视角,并促成两场的联合体渲染。此外,我们提出两种自蒸馏机制,即语义蒸馏损失与深度引导语义蒸馏损失,以增强语义场的判别性与质量以及几何一致性的保持。在评估中,我们在合成与真实世界数据集上基于两项感知任务(即语义与实例分割)进行了实验对比。值得注意的是,我们的方法在广义语义分割、微调语义分割和实例分割上分别超越SOTA方法6.94%、11.76%和8.47%。

关键词

引用

@article{arxiv.2311.11863,
  title  = {GP-NeRF: Generalized Perception NeRF for Context-Aware 3D Scene Understanding},
  author = {Hao Li and Dingwen Zhang and Yalun Dai and Nian Liu and Lechao Cheng and Jingfeng Li and Jingdong Wang and Junwei Han},
  journal= {arXiv preprint arXiv:2311.11863},
  year   = {2024}
}

备注

CVPR 2024 (Highlight). Project Page: https://lifuguan.github.io/gpnerf-pages/