中文

强化学习对比PDE反步与PI控制用于拥堵高速公路交通

最优化与控制 2021-01-18 v2 偏微分方程分析

摘要

我们开发强化学习(RL)边界控制器以缓解高速公路路段的停走交通拥堵。该路段交通动力学由宏观Aw-Rascle-Zhang (ARZ)模型支配,该模型由描述交通密度与速度的2×22\times 2拟线性偏微分方程(PDEs)组成。线性化ARZ PDE模型的边界镇定已由PDE反步法解决,保证了交通状态的空间L2L^2范数调节至均匀密度与速度,并确保交通振荡被抑制。并置比例(P)与比例-积分(PI)控制器在某些受限条件下也提供稳定性保证,并且作为无模型控制选项通过试错调参或免模型优化始终适用。尽管这些方法在数学上优雅,镇定结果仅局部成立且通常受模型参数变化影响。因此,我们将PDE边界控制问题重新表述为一个RL问题,在不了解系统动力学的情况下,仅通过观测状态值来追求镇定。采用近端策略优化(一种基于神经网络的策略梯度算法),通过与ARZ PDE数值模拟器交互获得RL控制器。受镇定启发,RL状态反馈边界控制器在两种情形下与严格镇定控制器进行比较评估:(i) 具有交通流动力学完美知识的系统,以及(ii) 仅具部分知识的系统。我们得到的RL控制器在完美知识下几乎恢复反步、P与PI控制器的性能,并在部分知识的某些情形下优于它们。

关键词

引用

@article{arxiv.1904.12957,
  title  = {Reinforcement Learning versus PDE Backstepping and PI Control for Congested Freeway Traffic},
  author = {Huan Yu and Saehong Park and Alexandre Bayen and Scott Moura and Miroslav Krstic},
  journal= {arXiv preprint arXiv:1904.12957},
  year   = {2021}
}