BEV-Seg:基于几何与语义点鸟的俯视语义分割
计算机视觉与模式识别
2020-06-24 v2
摘要
鸟瞰图(BEV)是一种强大且被广泛采用的道路场景表示,能够捕捉周围物体及其空间位置以及场景的整体上下文。本文关注鸟瞰语义分割任务,即从侧面 RGB 图像预测 BEV 中的逐像素语义分割。该任务得益于 Carla 等模拟器,其允许廉价的数据采集、任意相机布置,以及现实世界中无法实现的监督方式。该任务面临两大挑战:从侧视图到鸟瞰图的视角变换,以及向未知领域的迁移学习。现有工作通过全连接层进行视角间变换,并通过 GAN 进行迁移学习,这存在深度推理不足和跨领域性能下降的问题。我们提出的新型两阶段感知流水线显式预测像素深度,并将其与像素语义高效结合,使模型能够利用深度信息推断物体在 BEV 中的空间位置。此外,我们通过抽象高层几何特征并预测跨不同领域通用的中间表示来实现迁移学习。我们发布了一个名为 BEVSEG-Carla 的新数据集,并表明我们的方法将 SOTA 提升了 24% mIoU,且在迁移到新领域时表现良好。
引用
@article{arxiv.2006.11436,
title = {BEV-Seg: Bird's Eye View Semantic Segmentation Using Geometry and Semantic Point Cloud},
author = {Mong H. Ng and Kaahan Radia and Jianfei Chen and Dequan Wang and Ionel Gog and Joseph E. Gonzalez},
journal= {arXiv preprint arXiv:2006.11436},
year = {2020}
}
备注
Accepted into CVPR 2020 Workshop Scalability in Autonomous Driving by Waymo