用于三维场景理解的多视图PointNet
计算机视觉与模式识别
2019-10-01 v1
摘要
2D图像与3D点云的融合十分重要,因为来自稠密图像的信息可增强稀疏点云。然而,由于2D与3D数据处于不同空间,融合具有挑战性。本工作中,我们提出MVPNet(多视图PointNet),将2D多视图图像特征聚合到3D点云中,然后使用基于点的网络在3D规范空间中融合特征以预测3D语义标签。为此,我们引入了视图选择以及2D-3D特征聚合模块。大量实验显示了利用稠密图像特征的益处,并揭示出相较于仅用3D的方法对点云密度变化具有更优的鲁棒性。在ScanNetV2基准上,我们的MVPNet在3D语义分割任务上显著优于先前基于点云的方法。它比稀疏体素方法的大型网络训练快得多。我们提供了扎实的消融研究,以简化未来2D-3D融合方法的设计及其向其他任务的扩展,正如我们在3D实例分割中所展示的那样。
引用
@article{arxiv.1909.13603,
title = {Multi-view PointNet for 3D Scene Understanding},
author = {Maximilian Jaritz and Jiayuan Gu and Hao Su},
journal= {arXiv preprint arXiv:1909.13603},
year = {2019}
}
备注
Geometry Meets Deep Learning Workshop, ICCV 2019