中文

深度强化学习与模型预测控制在自适应巡航控制中的比较

系统与控制 2020-08-04 v3 系统与控制

摘要

本研究比较了深度强化学习(DRL)与模型预测控制(MPC)在跟车场景下的自适应巡航控制(ACC)设计中的应用。采用一阶系统作为面向控制的模型(COM)来近似车辆的加速度指令动力学。基于控制系统方程与多目标代价函数,我们使用深度确定性策略梯度(DDPG)训练 DRL 策略,并通过内点优化(IPO)求解 MPC 问题。回合代价的仿真结果表明,在无建模误差且测试输入处于训练数据范围内时,DRL 解等价于具有足够长预测时域的 MPC。具体而言,DRL 回合代价仅比通过 IPO 优化整个回合所得的基准解高 5.8%。当测试输入超出训练数据范围时,DRL 控制性能下降,表明其泛化能力不足。当存在由控制延迟、扰动和/或使用车辆高保真模型(HFM)测试所引起的建模误差时,在建模误差较大时 DRL 训练策略表现更优,而在建模误差较小时与 MPC 性能相近。

关键词

引用

@article{arxiv.1910.12047,
  title  = {Comparison of Deep Reinforcement Learning and Model Predictive Control for Adaptive Cruise Control},
  author = {Yuan Lin and John McPhee and Nasser L. Azad},
  journal= {arXiv preprint arXiv:1910.12047},
  year   = {2020}
}