中文

面向视觉鸟瞰图语义分割的半监督学习

计算机视觉与模式识别 2024-02-27 v2

摘要

视觉鸟瞰图(BEV)语义分割仅通过图像帮助自动驾驶车辆理解周边环境,包括静态元素(如道路)与动态元素(如车辆、行人)。然而,全监督方法的标注过程成本高昂,限制了视觉BEV语义分割的能力,其通常需要高清地图、3D物体边界框与相机外参矩阵。本文提出一种新颖的视觉BEV语义分割半监督框架,通过在训练中利用无标注图像提升性能。进而提出一种充分利用无标注数据的一致性损失,以在语义预测与BEV特征上同时约束模型。此外,我们提出一种新颖有效的数据增强方法——联合旋转,在保持前视图像与BEV语义分割之间几何关系的同时合理扩充数据集。在nuScenes与Argoverse数据集上的大量实验表明,我们的半监督框架能有效提升预测精度。据我们所知,这是首个探索利用无标注数据改善视觉BEV语义分割性能的工作。代码见 https://github.com/Junyu-Z/Semi-BEVseg

关键词

引用

@article{arxiv.2308.14525,
  title  = {Semi-Supervised Learning for Visual Bird's Eye View Semantic Segmentation},
  author = {Junyu Zhu and Lina Liu and Yu Tang and Feng Wen and Wanlong Li and Yong Liu},
  journal= {arXiv preprint arXiv:2308.14525},
  year   = {2024}
}

备注

Accepted by ICRA2024