中文

BEV-MODNet:基于单目相机的自动驾驶鸟瞰图运动目标检测

计算机视觉与模式识别 2021-07-13 v1 机器人学

摘要

运动目标检测是自动驾驶系统中一项非常重要的任务。在感知阶段之后,运动规划通常在鸟瞰图(BEV)空间中进行。这需要将图像平面上检测到的物体投影到俯视 BEV 平面。由于缺乏深度信息以及远处区域映射存在噪声,此类投影容易出错。CNN 可利用场景中的全局上下文实现更好的投影。本工作中,我们探索直接使用单目图像作为输入,在 BEV 图上端到端地进行运动目标检测(MOD)。据我们所知,此类数据集尚不存在,我们创建了扩展的 KITTI-raw 数据集,包含 12.9k 张图像,带有 BEV 空间中五类运动目标掩码的标注。该数据集旨在用于与类别无关、基于运动线索的目标检测,类别作为元数据提供以更好地调优。我们设计并实现了一个双流 RGB 与光流融合架构,直接在 BEV 空间输出运动分割。我们将其与最先进的图像平面运动分割预测的逆透视映射进行比较。我们观察到使用简单基线实现,mIoU 显著提升了 13%。这证明了直接学习 BEV 空间中的运动分割输出的能力。我们的基线与数据集标注的定性结果可在 https://sites.google.com/view/bev-modnet 查看。

关键词

引用

@article{arxiv.2107.04937,
  title  = {BEV-MODNet: Monocular Camera based Bird's Eye View Moving Object Detection for Autonomous Driving},
  author = {Hazem Rashed and Mariam Essam and Maha Mohamed and Ahmad El Sallab and Senthil Yogamani},
  journal= {arXiv preprint arXiv:2107.04937},
  year   = {2021}
}

备注

Accepted for Oral Presentation at IEEE Intelligent Transportation Systems Conference (ITSC) 2021