中文

S3CNet:一种用于激光雷达点云的稀疏语义场景补全网络

计算机视觉与模式识别 2023-11-20 v1 人工智能 机器学习 机器人学

摘要

随着自动驾驶及类似机器人系统对鲁棒三维视觉的依赖日益增强,利用深度卷积神经网络处理激光雷达扫描已成为学术界与工业界的趋势。先前在极具挑战的语义场景补全任务(即从“稀疏”表示推断密集三维结构及相应语义标签)上的尝试,在提供密集点云或密集深度图(常融合来自RGB图像的语义分割图)时,于小型室内场景中已取得一定成功。然而,当应用于具有动态且呈指数级稀疏特征的大型室外场景时,这些系统的性能急剧下降。同样,由于内存限制,处理整个稀疏体素变得不可行,而权宜之计引入了计算低效,因为从业者被迫将整体体素划分为多个相等片段并逐一推断,使实时性能无法实现。在本工作中,我们提出一种涵盖大规模环境稀疏性的方法,并给出S3CNet——一种基于稀疏卷积的神经网络,可从单一统一的激光雷达点云预测语义补全场景。我们表明,所提方法在三维任务上优于所有同类方法,在SemanticKITTI基准上取得最先进结果。此外,我们提出具有多视图融合策略的S3CNet二维变体,以补充我们的三维网络,增强对遮挡及远处极端稀疏性的鲁棒性。我们针对二维语义场景补全任务开展实验,并将我们的稀疏二维网络与多个领先的、适用于鸟瞰图分割的激光雷达分割模型在两个开源数据集上进行比较。

关键词

引用

@article{arxiv.2012.09242,
  title  = {S3CNet: A Sparse Semantic Scene Completion Network for LiDAR Point Clouds},
  author = {Ran Cheng and Christopher Agia and Yuan Ren and Xinhai Li and Liu Bingbing},
  journal= {arXiv preprint arXiv:2012.09242},
  year   = {2023}
}

备注

14 pages