面向自动驾驶匝道汇入的深度强化学习架构构建
机器学习
2019-02-05 v3 人工智能
摘要
多家汽车制造商正在开发或已量产提供高速公路领航功能的自动驾驶系统(ADS)。此类 ADS 通常仅限于封闭高速公路,即从手动模式到自动模式的切换仅在匝道汇入过程手动完成后进行。将自动化扩展至匝道汇入面临的一大挑战是,自动驾驶车辆需要在执行短期安全动作的同时,整合并优化长期目标(例如成功且平滑地汇入)。此外,汇入过程涉及与其他车辆的交互,这些车辆的行为有时难以预测,但可能会影响汇入车辆的最优动作。为解决这一复杂的控制问题,我们提出应用深度强化学习(DRL)技术,通过在交互环境中最大化长期奖励来寻找最优驾驶策略。具体而言,我们应用长短期记忆(LSTM)架构对交互环境进行建模,从中将包含历史驾驶信息的内部状态传递至深度 Q 网络(DQN)。DQN 用于近似 Q 函数,该函数以内部状态为输入,生成用于动作选择的 Q 值。借助此 DRL 架构,可以捕捉交互环境对长期奖励的历史影响,并在决定最优控制策略时予以考虑。所提出的架构具有扩展并应用于其他自动驾驶场景的潜力,例如在复杂路口行驶或在变化的交通流条件下变道。
引用
@article{arxiv.1709.02066,
title = {Formulation of Deep Reinforcement Learning Architecture Toward Autonomous Driving for On-Ramp Merge},
author = {Pin Wang and Ching-Yao Chan},
journal= {arXiv preprint arXiv:1709.02066},
year = {2019}
}
备注
IEEE International Conference on Intelligent Transportation Systems, Yokohama, Japan, 2017