Cylinder3D:一种用于驾驶场景LiDAR语义分割的有效3D框架
计算机视觉与模式识别
2020-08-05 v1
摘要
用于大规模驾驶场景LiDAR语义分割的最先进方法通常将点云投影并在2D空间中处理。投影方法包括球面投影、鸟瞰图投影等。尽管该过程使点云适用于基于2D CNN的网络,但它不可避免地改变并舍弃了3D拓扑和几何关系。解决3D到2D投影问题的一个直接方案是保持3D表示并在3D空间中处理点。在这项工作中,我们首先对2D和3D空间中不同的表示和骨干网络进行了深入分析,并揭示了3D表示和网络在LiDAR分割上的有效性。然后,我们开发了一种基于3D圆柱划分和3D圆柱卷积的框架,称为Cylinder3D,其利用了驾驶场景点云的3D拓扑关系和结构。此外,引入了基于维度分解的上下文建模模块,以渐进方式探索点云中的高阶上下文信息。我们在一个大规模驾驶场景数据集即SematicKITTI上评估了所提出的模型。我们的方法实现了最先进的性能,并在mIoU方面以6%的优势超越现有方法。
引用
@article{arxiv.2008.01550,
title = {Cylinder3D: An Effective 3D Framework for Driving-scene LiDAR Semantic Segmentation},
author = {Hui Zhou and Xinge Zhu and Xiao Song and Yuexin Ma and Zhe Wang and Hongsheng Li and Dahua Lin},
journal= {arXiv preprint arXiv:2008.01550},
year = {2020}
}
备注
Source code: https://github.com/xinge008/Cylinder3D