中文

基于模型动作提议的摊销 Q 学习用于高速公路自动驾驶

机器学习 2020-12-08 v1 机器人学

摘要

成熟的基于优化的方法能够保证较短优化时域(通常不超过几秒)内的最优轨迹。因此,选择该短时域的最优轨迹仍可能导致次优的长期解。同时,由此产生的短期轨迹能够在动态交通环境中实现有效、舒适且可证明安全的机动。在本工作中,我们探讨如何在保持经典轨迹规划优势的同时确保最优的长期驾驶策略。我们引入一种基于强化学习的方法,该方法与轨迹规划器耦合,学习高速公路驾驶的最优长期决策策略。通过在线生成局部最优机动作为动作,我们在无限的低层连续动作空间与固定数量预定义标准换道动作的有限灵活性之间取得平衡。我们在开源交通模拟器 SUMO 中的真实场景上评估了我们的方法,并相较于我们所对比的 4 种基准方法(包括随机动作选择智能体、贪婪智能体、高层离散动作智能体以及基于 IDM 的 SUMO 控制智能体)取得了更优性能。

关键词

引用

@article{arxiv.2012.03234,
  title  = {Amortized Q-learning with Model-based Action Proposals for Autonomous Driving on Highways},
  author = {Branka Mirchevska and Maria Hügle and Gabriel Kalweit and Moritz Werling and Joschka Boedecker},
  journal= {arXiv preprint arXiv:2012.03234},
  year   = {2020}
}