中文

基于连续动作空间强化学习的自主匝道汇入机动

人工智能 2018-03-28 v1 机器人学

摘要

匝道汇入是关乎道路安全和交通效率的关键机动。目前由多家汽车制造商和供应商开发的大多数自动驾驶系统通常仅限于限制出入的高速公路。将自动驾驶模式扩展到匝道汇入区面临巨大挑战。其一是在执行当前动作时,自动驾驶车辆需要纳入未来目标(例如成功且平滑的汇入)并优化受后续动作影响的长期奖励。此外,汇入过程涉及汇入车辆与周围车辆之间的交互,其行为可能是合作的也可能是对抗的,从而导致对成功完成汇入至关重要的不同汇入对策。代替传统的基于规则的方法,我们提出在自动驾驶车辆智能体上应用强化学习算法,通过在交互式驾驶环境中最大化长期奖励来寻找最优驾驶策略。最重要的是,与大多数将动作空间解析为离散的强化学习应用相比,我们的方法将动作空间和状态空间均视为连续的,且不会产生额外的计算成本。我们独特的贡献是设计了格式为二次函数的 Q 函数逼近,通过该逼近使用简单但有效的神经网络来估计其系数。通过我们的训练平台实现的结果表明,车辆智能体能够学习安全、平滑且及时的汇入策略,表明了我们方法的有效性和实用性。

关键词

引用

@article{arxiv.1803.09203,
  title  = {Autonomous Ramp Merge Maneuver Based on Reinforcement Learning with Continuous Action Space},
  author = {Pin Wang and Ching-Yao Chan},
  journal= {arXiv preprint arXiv:1803.09203},
  year   = {2018}
}