中文

基于多视角注意力学习扩展视觉端到端驾驶

计算机视觉与模式识别 2023-07-25 v3

摘要

在端到端驾驶中,人类驾驶演示通过模仿学习来训练基于感知的驾驶模型。该过程以车辆信号(如转向角、加速度)作为监督,但不需要对传感器数据施加额外昂贵的标注监督。作为此类基于视觉的端到端驾驶模型的代表,CILRS 常被用作与新驾驶模型比较的基线。迄今为止,一些最新模型通过使用昂贵的传感器套件和/或大量人工标注数据训练,取得了优于 CILRS 的性能。鉴于性能差异,有人可能认为追求基于视觉的纯端到端驾驶已无价值。然而,我们主张考虑到成本与维护,该方法仍具重大价值与潜力。本文提出 CIL++,它在 CILRS 基础上,既利用受人类启发的人眼视场角(HFOV)作为归纳偏置处理更高分辨率图像,又引入了恰当的注意力机制。CIL++ 与开发成本更高的模型相比具有竞争力。我们建议以 CIL++ 替代 CILRS,作为仅由车辆信号监督、通过条件模仿学习训练的强视觉纯端到端驾驶基线。

关键词

引用

@article{arxiv.2302.03198,
  title  = {Scaling Vision-based End-to-End Driving with Multi-View Attention Learning},
  author = {Yi Xiao and Felipe Codevilla and Diego Porres and Antonio M. Lopez},
  journal= {arXiv preprint arXiv:2302.03198},
  year   = {2023}
}

备注

This paper has been accepted to the 2023 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2023)