Point-Voxel CNN:用于高效三维深度学习的点-体素卷积神经网络
计算机视觉与模式识别
2019-12-11 v2
摘要
我们提出 Point-Voxel CNN (PVCNN) 以实现高效、快速的三维深度学习。已有工作使用基于体素或基于点的神经网络模型来处理三维数据,但这两种方法在计算上均效率低下。基于体素的模型的计算开销与内存占用随输入分辨率呈三次方增长,使得提升分辨率在内存上难以承受。而对于基于点的网络,高达 80% 的时间浪费在结构化稀疏数据上,这些数据内存局部性相当差,而非用于实际的特征提取。本文中,我们提出 PVCNN,以点的形式表示三维输入数据以降低内存消耗,同时在体素上执行卷积以减少不规则、稀疏的数据访问并改善局部性。我们的 PVCNN 模型在内存与计算上均高效。在语义与部件分割数据集上的评估表明,其以 10 倍 GPU 内存削减实现了远高于基于体素的基线的精度;它还在平均 7 倍实测加速下优于最先进的基于点的模型。值得注意的是,更窄版本的 PVCNN 在部件与场景分割基准上以远高于 PointNet(一种极高效的模型)的精度实现了 2 倍加速。我们在三维目标检测上验证了 PVCNN 的普遍有效性:通过将 Frustrum PointNet 中的基元替换为 PVConv,其以平均 2.4% mAP 优于 Frustrum PointNet++,并具有 1.5 倍实测加速与 GPU 内存削减。
引用
@article{arxiv.1907.03739,
title = {Point-Voxel CNN for Efficient 3D Deep Learning},
author = {Zhijian Liu and Haotian Tang and Yujun Lin and Song Han},
journal= {arXiv preprint arXiv:1907.03739},
year = {2019}
}
备注
NeurIPS 2019. The first two authors contributed equally to this work. Project page: http://pvcnn.mit.edu/