3DMV:用于3D语义场景分割的联合3D-多视图预测
计算机视觉与模式识别
2018-03-29 v1
摘要
我们提出了3DMV,一种利用联合3D-多视图预测网络对室内环境RGB-D扫描进行3D语义场景分割的新方法。与此任务中现有方法仅使用几何或RGB数据作为输入不同,我们将两种数据模态结合在一个联合的端到端网络架构中。我们并非简单地将颜色数据投影到体素网格并仅在3D中操作——这会导致细节不足——而是首先从关联的RGB图像中提取特征图。然后,使用可微的反向投影层将这些特征映射到3D网络的体素特征网格中。由于我们的目标是可能包含许多帧的3D扫描场景,我们使用多视图池化方法来处理数量可变的RGB输入视图。这种通过我们联合2D-3D架构学习结合RGB与几何特征的方法,取得了显著优于现有基线的结果。例如,与现有的体素架构相比,我们在ScanNet 3D分割基准上的最终结果准确率从52.8%提升至75%。
引用
@article{arxiv.1803.10409,
title = {3DMV: Joint 3D-Multi-View Prediction for 3D Semantic Scene Segmentation},
author = {Angela Dai and Matthias Nießner},
journal= {arXiv preprint arXiv:1803.10409},
year = {2018}
}