中文

3DMV:用于3D语义场景分割的联合3D-多视图预测

计算机视觉与模式识别 2018-03-29 v1

摘要

我们提出了3DMV,一种利用联合3D-多视图预测网络对室内环境RGB-D扫描进行3D语义场景分割的新方法。与此任务中现有方法仅使用几何或RGB数据作为输入不同,我们将两种数据模态结合在一个联合的端到端网络架构中。我们并非简单地将颜色数据投影到体素网格并仅在3D中操作——这会导致细节不足——而是首先从关联的RGB图像中提取特征图。然后,使用可微的反向投影层将这些特征映射到3D网络的体素特征网格中。由于我们的目标是可能包含许多帧的3D扫描场景,我们使用多视图池化方法来处理数量可变的RGB输入视图。这种通过我们联合2D-3D架构学习结合RGB与几何特征的方法,取得了显著优于现有基线的结果。例如,与现有的体素架构相比,我们在ScanNet 3D分割基准上的最终结果准确率从52.8%提升至75%。

关键词

引用

@article{arxiv.1803.10409,
  title  = {3DMV: Joint 3D-Multi-View Prediction for 3D Semantic Scene Segmentation},
  author = {Angela Dai and Matthias Nießner},
  journal= {arXiv preprint arXiv:1803.10409},
  year   = {2018}
}