中文

Urban Driver:利用策略梯度从真实世界演示中学习驾驶

机器人学 2021-09-29 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

在这项工作中,我们首次提出了一种离线策略梯度方法,用于从大规模真实世界演示语料中学习复杂城市驾驶的模仿策略。这是通过在感知输出和该地区高保真 HD 地图之上构建可微分数据驱动模拟器来实现的。它允许我们使用中间层表示从现有演示中合成新的驾驶经验。利用该模拟器,我们随后采用策略梯度在闭环中训练策略网络。我们在城市道路上 100 小时的专家演示上训练所提方法,并展示其学习了能良好泛化且可执行多种驾驶操纵的复杂驾驶策略。我们在模拟中展示了这一点,并将我们的模型部署到真实世界的自动驾驶车辆上。我们的方法优于先前展示的城市场景最先进水平——所有这些都不需要复杂的状态扰动或在训练期间收集额外的在策略数据。我们公开了代码和数据。

关键词

引用

@article{arxiv.2109.13333,
  title  = {Urban Driver: Learning to Drive from Real-world Demonstrations Using Policy Gradients},
  author = {Oliver Scheel and Luca Bergamini and Maciej Wołczyk and Błażej Osiński and Peter Ondruska},
  journal= {arXiv preprint arXiv:2109.13333},
  year   = {2021}
}

备注

CoRL 2021