FIDNet:基于全插值解码的LiDAR点云语义分割
计算机视觉与模式识别
2021-09-09 v1 机器人学
摘要
将点云投影到二维球面距离图像上,可将LiDAR语义分割转化为距离图像上的二维分割任务。然而,LiDAR距离图像本质上仍不同于常规的二维RGB图像;例如,距离图像上的每个位置都编码了独特的几何信息。在本文中,我们提出一种新的基于投影的LiDAR语义分割流程,该流程包含一个新颖的网络结构和一个高效的后处理步骤。在我们的网络结构中,我们设计了一个FID(全插值解码)模块,该模块使用双线性插值直接上采样多分辨率特征图。受PointNet++中使用的三维距离插值启发,我们认为此FID模块是 空间上的二维版本距离插值。作为一个无参数解码模块,FID在保持良好性能的同时大幅降低了模型复杂度。除了网络结构,我们通过经验发现,我们的模型预测在不同语义类别之间具有清晰的边界。这促使我们重新思考广泛使用的K近邻后处理对我们的流程是否仍然必要。随后,我们意识到多对一映射会导致模糊效应,即一些点被映射到同一像素并共享同一标签。因此,我们提出通过为这些被遮挡点分配最近的预测标签来处理它们。在消融研究中,这种NLA(最近标签分配)后处理步骤展现出比KNN更好的性能,且推理速度更快。在SemanticKITTI数据集上,我们的流程在分辨率为 的所有基于投影的方法以及所有逐点解决方案中均取得了最佳性能。以ResNet-34为骨干网络,我们模型的训练和测试均可在单块11G显存的RTX 2080 Ti上完成。代码已发布。
引用
@article{arxiv.2109.03787,
title = {FIDNet: LiDAR Point Cloud Semantic Segmentation with Fully Interpolation Decoding},
author = {Yiming Zhao and Lin Bai and Xinming Huang},
journal= {arXiv preprint arXiv:2109.03787},
year = {2021}
}
备注
Accepted by IROS'21, code link: https://github.com/placeforyiming/IROS21-FIDNet-SemanticKITTI