基于相机的带稀疏引导网络的三维语义场景补全
计算机视觉与模式识别
2024-10-01 v2
摘要
语义场景补全 (SSC) 旨在从有限的观测中预测整个 3D 场景中每个体素的语义占用情况,这是自动驾驶中一项新兴且关键的任务。最近,由于相机具有更丰富的视觉线索和成本效益,许多研究转向基于相机的 SSC 解决方案。然而,现有方法通常依赖复杂且庞大的 3D 模型直接处理提升后的 3D 特征,这对于清晰的分割边界来说判别力不足。在本文中,我们采用密集-稀疏-密集的设计,提出了一种单阶段基于相机的 SSC 框架,称为 SGN,基于空间几何线索将语义从语义感知的种子体素传播到整个场景。首先,为了利用深度感知上下文并动态选择稀疏种子体素,我们重新设计了稀疏体素提议网络,以由粗到细的范式直接处理由深度预测生成的点。此外,通过设计混合引导(稀疏语义和几何引导)和用于空间几何线索的有效体素聚合,我们增强了不同类别之间的特征分离并加速了语义传播的收敛。最后,我们设计了多尺度语义传播模块,在减少计算资源的同时提供灵活的感受野。在 SemanticKITTI 和 SSCBench-KITTI-360 数据集上的大量实验结果证明了我们的 SGN 优于现有的最先进方法。甚至我们的轻量级版本 SGN-L 在 SeamnticKITTI 验证集上仅用 12.5 M 参数和 7.16 G 训练内存就取得了 14.80\% mIoU 和 45.45\% IoU 的显著分数。代码可在 https://github.com/Jieqianyu/SGN 获取。
引用
@article{arxiv.2312.05752,
title = {Camera-based 3D Semantic Scene Completion with Sparse Guidance Network},
author = {Jianbiao Mei and Yu Yang and Mengmeng Wang and Junyu Zhu and Jongwon Ra and Yukai Ma and Laijian Li and Yong Liu},
journal= {arXiv preprint arXiv:2312.05752},
year = {2024}
}
备注
Accepted by IEEE TIP 2024