中文

重新思考自动驾驶的闭环训练

机器人学 2023-06-29 v1 计算机视觉与模式识别 机器学习

摘要

高保真模拟器的最新进展使得自动驾驶智能体的闭环训练成为可能,这有望解决训练与部署中的分布偏移,并允许以安全且廉价的方式扩展训练。然而,对于如何构建有效的闭环训练基准缺乏理解。在本工作中,我们呈现首个实证研究中分析了不同训练基准设计对学习型智能体成功的影响,例如如何设计交通场景与扩展训练环境。此外,我们展示许多流行的 RL 算法在自动驾驶背景下无法取得满意性能,因其缺乏长期规划且训练耗时极长。为解决这些问题,我们提出轨迹值学习(TRAVL),一种基于 RL 的驾驶智能体,其通过多步前瞻进行规划,并利用廉价生成的想象数据实现高效学习。我们的实验表明,与所有基线相比,TRAVL 学习速度快得多且产生更安全的操纵。更多信息见项目网站:https://waabi.ai/research/travl

关键词

引用

@article{arxiv.2306.15713,
  title  = {Rethinking Closed-loop Training for Autonomous Driving},
  author = {Chris Zhang and Runsheng Guo and Wenyuan Zeng and Yuwen Xiong and Binbin Dai and Rui Hu and Mengye Ren and Raquel Urtasun},
  journal= {arXiv preprint arXiv:2306.15713},
  year   = {2023}
}

备注

ECCV 2022