用于鸟瞰图语义分割的残差图卷积网络
计算机视觉与模式识别
2023-12-08 v1
摘要
检索空间信息并理解周围环境的语义信息对于鸟瞰图语义分割至关重要。在自动驾驶应用中,自动驾驶车辆需要感知周围环境以安全行驶。然而,当前的 BEV 语义分割技术,即深度卷积神经网络和 Transformer,难以在网络早期层获取周围环境的全局语义关系。在本文中,我们提出在深度 CNN 中引入一种新颖的残差图卷积模块,以在多视图图像域中同时获取全局信息和区域级语义关系。具体而言,RGC 模块采用无重叠图空间投影,将完整的 BEV 信息高效投影到图空间。随后,它构建互联的空间图和通道图,以提取每个节点之间的空间信息及每个节点内的通道信息(即提取全局特征的上下文关系)。此外,它使用下采样残差过程来增强坐标特征重用,从而保持全局信息。分割数据增强与对齐模块有助于同时增强和对齐 BEV 特征与真实值,以在几何上保持它们的对齐,从而实现更好的分割结果。我们在 nuScenes 基准数据集上的实验结果表明,RGC 网络在 IoU 和 mIoU 方面优于四个 SOTA 网络及其四个变体。所提出的 RGC 网络比最佳的 SOTA 网络 BEVFusion 高出 3.1\% 的 mIoU。代码和模型将公开发布。
引用
@article{arxiv.2312.04044,
title = {Residual Graph Convolutional Network for Bird's-Eye-View Semantic Segmentation},
author = {Qiuxiao Chen and Xiaojun Qi},
journal= {arXiv preprint arXiv:2312.04044},
year = {2023}
}
备注
8 pages, 5 figures, this paper has been accepted by and will be presented at the WACV 2024