变道战术决策的新方法:带安全反馈奖励的样本高效深度 Q 学习
人工智能
2020-09-28 v1 机器学习
机器人学
摘要
自动变道是高度自动驾驶车辆最具挑战性的任务之一,因其具有安全关键、不确定及多智能体的性质。本文提出了一种前沿 Q 学习方法——即 Rainbow DQN——的新颖应用,其采用一种新的安全驱动奖励方案,以在动态且不确定的仿真环境中应对相关问题。我们给出了多种对比结果,表明这种来自安全层的奖励反馈的新颖方法显著提升了智能体的性能与样本效率。此外,通过 Rainbow DQN 的新颖部署,表明通过考察智能体生成的 Q 值分布可提取出关于智能体动作的更多直观理解。所提算法在仅 200000 训练步(即相当于 55 小时驾驶)的困难场景中,表现出优于基线算法的性能。
引用
@article{arxiv.2009.11905,
title = {A New Approach for Tactical Decision Making in Lane Changing: Sample Efficient Deep Q Learning with a Safety Feedback Reward},
author = {M. Ugur Yavas and N. Kemal Ure and Tufan Kumbasar},
journal= {arXiv preprint arXiv:2009.11905},
year = {2020}
}