GP-S3Net:基于图的全景稀疏语义分割网络
计算机视觉与模式识别
2021-08-20 v1
摘要
全景分割作为静态环境理解与动态物体识别的集成任务,近来开始受到广泛研究关注。本文中,我们提出一种计算高效的基于 LiDAR 的全景分割框架,称为 GP-S3Net。GP-S3Net 是一种无需提案的方法,与常规两阶段全景系统(其中引入检测网络以获取实例信息)不同,它无需物体提案即可识别物体。我们的新设计包含一个新颖的实例级网络,通过构建图卷积网络处理语义结果以识别物体(前景),随后将其与背景类别融合。通过来自语义分割骨干网络的前景物体细粒度聚类,生成过分割先验,随后由 3D 稀疏卷积处理以嵌入每个聚类。每个聚类被视为图中的一个节点,其对应嵌入用作节点特征。然后 GCNN 预测每对聚类间是否存在边。我们利用实例标签为所构建的每个图生成真值边标签以监督学习。大量实验表明,GP-S3Net 在 nuScenes 和 SemanticPOSS 等可用数据集上以显著优势超越当前 SOTA 方法,并在发表时在具竞争力的公开 SemanticKITTI 排行榜上排名第一。
引用
@article{arxiv.2108.08401,
title = {GP-S3Net: Graph-based Panoptic Sparse Semantic Segmentation Network},
author = {Ryan Razani and Ran Cheng and Enxu Li and Ehsan Taghavi and Yuan Ren and Liu Bingbing},
journal= {arXiv preprint arXiv:2108.08401},
year = {2021}
}