中文

FPS-Net:一种用于大规模激光雷达点云分割的卷积融合网络

计算机视觉与模式识别 2021-07-19 v1 人工智能

摘要

基于激光雷达点云的场景理解是自动驾驶汽车安全行驶的一项基本任务,常采用球面投影将3D点云映射为多通道2D图像以进行语义分割。现有多数方法简单地将不同点属性/模态(如坐标、强度、深度等)堆叠为图像通道以提升信息容量,却忽略了不同图像通道中点属性的独特特征。我们设计了FPS-Net,一种利用投影图像通道间独特性与差异性的卷积融合网络,以实现最优点云分割。FPS-Net采用编码器-解码器结构。我们并非简单堆叠多通道图像作为单一输入,而是将其分组为不同模态,先分别学习模态特定特征,再将所学特征映射至公共高维特征空间进行像素级融合与学习。具体而言,我们在编码器中设计带有多感受野的残差稠密块作为基本单元,以保留各模态细节信息并有效学习分层模态特定与融合特征。在FPS-Net解码器中,我们同样使用循环卷积块将融合特征分层解码至输出空间以进行像素级分类。在两个广泛采用的点云数据集上的大量实验表明,与最先进的基于投影的方法相比,FPS-Net取得了更优的语义分割效果。此外,所提模态融合思想与典型基于投影的方法兼容,并可被引入其中带来一致的性能提升。

关键词

引用

@article{arxiv.2103.00738,
  title  = {FPS-Net: A Convolutional Fusion Network for Large-Scale LiDAR Point Cloud Segmentation},
  author = {Aoran Xiao and Xiaofei Yang and Shijian Lu and Dayan Guan and Jiaxing Huang},
  journal= {arXiv preprint arXiv:2103.00738},
  year   = {2021}
}

备注

20 pages, 7 figures