中文

面向自动驾驶的多摄像头鸟瞰图感知

机器人学 2023-09-20 v2 计算机视觉与模式识别

摘要

大多数自动驾驶系统包含多样的传感器集合,包括若干摄像头、雷达与LiDAR,确保在近端与远端区域完整的360°覆盖。与直接以3D测量的雷达和LiDAR不同,摄像头捕获具有固有深度模糊的2D透视投影。然而,为支持对其他智能体与结构的空间推理以实现最优路径规划,必须产生3D感知输出。3D空间通常通过忽略不太相关的对应高度维度的Z坐标而简化为BEV空间。从摄像头图像获得所需BEV表示的最基本方法是IPM,其假设平坦地面。新车中相当常见的环视系统使用IPM原理生成BEV图像并显示给驾驶员。然而,该方法不适用于自动驾驶,因为这一过于简化的变换方法引入了严重畸变。更新的方法使用深度神经网络直接在BEV空间输出。这些方法在网络中隐式或显式地利用几何约束将摄像头图像变换至BEV空间。由于CNN具有更多上下文信息且可学习的变换更灵活并能适应图像内容,基于深度学习的方法确立了BEV变换的新基准并达到最先进性能。首先,本章讨论基于多摄像头的DNN(深度神经网络)直接在BEV空间输出目标表示的当代趋势。然后,我们讨论该方法如何扩展至有效的传感器融合及耦合下游任务(如态势分析与预测)。最后,我们展示BEV感知中的挑战与开放问题。

关键词

引用

@article{arxiv.2309.09080,
  title  = {Multi-camera Bird's Eye View Perception for Autonomous Driving},
  author = {David Unger and Nikhil Gosala and Varun Ravi Kumar and Shubhankar Borse and Abhinav Valada and Senthil Yogamani},
  journal= {arXiv preprint arXiv:2309.09080},
  year   = {2023}
}

备注

Taylor & Francis (CRC Press) book chapter. Book title: Computer Vision: Challenges, Trends, and Opportunities