基于深度强化学习的防冲击匝道汇入控制
系统与控制
2020-05-19 v3 系统与控制
摘要
本文利用深度强化学习(DRL)进行高速匝道汇入的分散式决策与纵向控制。DRL 环境状态包含五辆车的状态:汇入车辆,以及当汇入车辆位于或投影到主路时的前两辆与后两辆车。控制动作为汇入车辆的加速度。深度确定性策略梯度(DDPG)是用于训练以输出连续控制动作的 DRL 算法。我们通过获取帕累托前沿,研究了安全相关的避撞与乘客舒适度相关的冲击度最小化在多目标奖励函数中的关系。我们发现,在多目标奖励函数中加入较小的冲击度惩罚,相较于无冲击度惩罚,车辆冲击度可降低 73%,同时碰撞率保持为零。无论冲击度惩罚如何,汇入车辆均表现出诸如在主路车辆前或后汇入的决策策略。
引用
@article{arxiv.1909.12967,
title = {Anti-Jerk On-Ramp Merging Using Deep Reinforcement Learning},
author = {Yuan Lin and John McPhee and Nasser L. Azad},
journal= {arXiv preprint arXiv:1909.12967},
year = {2020}
}
备注
Accepted to 2020 IEEE Intelligent Vehicles Symposium