基于 Pixel-Voxel 神经网络的稠密 RGB-D 语义建图
计算机视觉与模式识别
2017-10-06 v3
摘要
对于智能机器人应用,将 3D 建图扩展至 3D 语义建图,使得机器人不仅能够根据场景的几何特征进行定位,还能同时理解场景上下文的更高层含义。尽管联合估计可以提升语义建图的精度,但以往的大多数方法均独立地进行几何 3D 重建与场景理解。本文提出了一种基于 Pixel-Voxel 网络的稠密 RGB-D 语义建图系统,该系统能够在进行稠密 3D 建图的同时,识别并对 3D 地图中的每个点进行语义标注。所提出的 Pixel-Voxel 网络通过使用 PixelNet 处理 RGB 图像来获取全局上下文信息,同时利用 VoxelNet 处理对应的 3D 点云以保留精确的局部形状信息。不同于以等权重融合来自不同模型得分图的现有架构,我们提出了一种 Softmax 加权融合栈,能够自适应地学习 PixelNet 和 VoxelNet 的不同贡献,并根据它们各自的置信度融合两个模型的得分图。所提出的 Pixel-Voxel 网络在 SUN RGB-D 基准数据集上取得了 SOTA 的语义分割性能。在配备 Titan X GPU 的 i7 8 核 PC 上,该系统的运行速度可提升至 11-12Hz,实现接近实时的性能。
引用
@article{arxiv.1710.00132,
title = {Dense RGB-D semantic mapping with Pixel-Voxel neural network},
author = {Cheng Zhao and Li Sun and Pulak Purkait and Rustam Stolkin},
journal= {arXiv preprint arXiv:1710.00132},
year = {2017}
}
备注
8 pages, 4 figures, 2 tables