S3Net:三维激光雷达稀疏语义分割网络
计算机视觉与模式识别
2021-03-17 v1
摘要
语义分割是许多应用(如依赖准确环境感知与理解的机器人和自动驾驶)感知系统中的关键组成部分。文献中引入了多种方法来尝试激光雷达语义分割任务,例如基于投影(距离视图或鸟瞰图)和基于体素的方法。然而,它们要么舍弃了有价值的三维拓扑与几何关系并遭受投影过程中引入的信息损失,要么效率低下。因此,需要能够在三维空间中处理三维驾驶场景点云的精确模型。本文中,我们提出 S3Net,一种用于激光雷达点云语义分割的新型卷积神经网络。它采用编码器-解码器骨干网络,由稀疏通道内注意力模块(SIntraAM)和稀疏通道间注意力模块(SInterAM)组成,以强调每个特征图内部及邻近特征图之间的精细细节。为在更深层提取全局上下文,我们引入了基于稀疏卷积、适应激光雷达点云不同稀疏性的稀疏残差塔。此外,利用地理感知各向异性损失来强调语义边界并惩罚每个预测区域内的噪声,从而实现鲁棒预测。我们的实验结果表明,所提方法在 SemanticKITTI 测试集上相比其基线对应方法(MinkNet42)有大幅提升(12%),并达到了语义分割方法的 SOTA mIoU 精度。
引用
@article{arxiv.2103.08745,
title = {S3Net: 3D LiDAR Sparse Semantic Segmentation Network},
author = {Ran Cheng and Ryan Razani and Yuan Ren and Liu Bingbing},
journal= {arXiv preprint arXiv:2103.08745},
year = {2021}
}