中文

通过零样本课程嵌入合成离策略经验用于自动驾驶

机器人学 2022-12-05 v1 人工智能 机器学习

摘要

基于机器学习运动规划是一种有前景的方法,可生成表现出复杂行为并自动适应新环境的智能体。在自动驾驶背景下,通常将所有可用训练数据同等对待。然而,这种方法产生的智能体在安全关键场景中表现不鲁棒,而仅向训练集添加更多数据无法解决该问题——我们表明,仅使用10%数据子集训练的智能体与使用整个数据集训练的智能体表现同样好。我们提出了一种方法,根据从部署在公共道路上的自动驾驶车队收集的数据,预测驾驶场景的固有难度。随后我们证明,该难度分数可用于零样本迁移,为基于模仿学习的规划智能体生成课程。与在整个无偏训练数据集上训练相比,我们表明优先处理困难驾驶场景在闭环评估中既将碰撞减少15%,又将路线保持率提高14%,且仅使用了10%的训练数据。

关键词

引用

@article{arxiv.2212.01375,
  title  = {Embedding Synthetic Off-Policy Experience for Autonomous Driving via Zero-Shot Curricula},
  author = {Eli Bronstein and Sirish Srinivasan and Supratik Paul and Aman Sinha and Matthew O'Kelly and Payam Nikdel and Shimon Whiteson},
  journal= {arXiv preprint arXiv:2212.01375},
  year   = {2022}
}

备注

Published in CoRL 2022. Main text (8 pages, 3 figures) + acknowledgements and references (3 pages) + appendix (7 pages, 4 figures)