中文

基于卷积变分编码器-解码器网络的单目语义占据栅格建图

机器人学 2019-05-01 v3 计算机视觉与模式识别

摘要

在这项工作中,我们研究并评估了从弱双目真值端到端学习单目语义-度量占据栅格建图。该网络学习预测四个类别,以及从相机到鸟瞰图的映射。其核心是利用一个变分编码器-解码器网络,该网络对驾驶场景的前视视觉信息进行编码,随后将其解码到二维顶视笛卡尔坐标系。在 Cityscapes 上的评估表明,语义-度量占据栅格的端到端学习比基于平面假设的确定性建图方法在平均 IoU 上高出 12% 以上。此外,我们展示了具有相对较小嵌入向量的变分采样带来了针对车辆动态扰动的鲁棒性,以及对未见的 KITTI 数据的泛化能力。我们的网络使用 Titan V GPU,对分辨率为 256x512 像素的输入图像和具有 64x64 占据栅格单元的输出地图实现了约 35 Hz 的实时推理速率。

关键词

引用

@article{arxiv.1804.02176,
  title  = {Monocular Semantic Occupancy Grid Mapping with Convolutional Variational Encoder-Decoder Networks},
  author = {Chenyang Lu and Marinus Jacobus Gerardus van de Molengraft and Gijs Dubbelman},
  journal= {arXiv preprint arXiv:1804.02176},
  year   = {2019}
}