多模态端到端自动驾驶
计算机视觉与模式识别
2020-10-27 v2
摘要
自动驾驶车辆(AV)的一个关键组成部分是能够驶向期望目的地的人工智能(AI)。如今,存在不同的范式来开发 AI 驾驶员。一方面,我们看到模块化流水线,将驾驶任务划分为感知、机动规划与控制等子任务。另一方面,端到端驾驶方法试图学习从输入原始传感器数据到车辆控制信号的直接映射。后者研究相对较少,但因对传感器数据标注需求较低而日益流行。本文聚焦于端到端自动驾驶。迄今为止,依赖该范式的大多数方案假定以 RGB 图像作为输入传感器数据。然而,AV 不仅将配备摄像头,还将配备提供精确深度信息的主动传感器(如 LiDARs)。据此,本文分析结合 RGB 与深度模态(即使用 RGBD 数据)是否能产生优于单一模态的端到端 AI 驾驶员。我们考虑基于早期、中期与晚期融合方案的多模态,涵盖多传感器与单传感器(单目深度估计)设置。利用 CARLA 模拟器与条件模仿学习(CIL),我们表明早期融合多模态确实优于单模态。
引用
@article{arxiv.1906.03199,
title = {Multimodal End-to-End Autonomous Driving},
author = {Yi Xiao and Felipe Codevilla and Akhil Gurram and Onay Urfalioglu and Antonio M. López},
journal= {arXiv preprint arXiv:1906.03199},
year = {2020}
}
备注
The paper has been accepted by IEEE Transactions on Intelligent Transportation Systems 2020