中文

基于强化学习的自适应巡航控制的安全滤波

系统与控制 2023-01-04 v1 系统与控制

摘要

基于强化学习(RL)的自适应巡航控制系统(ACC)能够学习并适应道路、交通和车辆状况,对于提升车辆能效和交通流具有吸引力。然而,在诸如 ACC 这类安全关键系统中应用 RL,需要强有力的安全保证,而这对于从根本上需要探索的学习智能体而言难以实现。在本文中,我们推导了控制障碍函数作为安全滤波器,使得基于 RL 的 ACC 控制器能够在碰撞安全集内自由探索。具体而言,我们针对高相对阶非线性系统推导了控制障碍函数,以考虑与商用车辆相关的惯性效应。我们还概述了一种利用这些障碍函数处理执行器饱和的算法。尽管任何 RL 算法均可作为性能 ACC 控制器与这些滤波器配合使用,我们实现了具有混合动作空间的 Maximum A Posteriori Policy Optimization(MPO)算法,该算法学习燃油最优的挡位选择与扭矩控制策略。我们将安全滤波 RL 方法与仅能在充分训练后学会避免碰撞的奖励塑形 RL 方法进行了对比。在不同行驶循环上的评估表明,与基线 ACC 算法相比,所提方法在燃油经济性方面有显著改善。

关键词

引用

@article{arxiv.2301.00884,
  title  = {Safety Filtering for Reinforcement Learning-based Adaptive Cruise Control},
  author = {Habtamu Hailemichael and Beshah Ayalew and Lindsey Kerbel and Andrej Ivanco and Keith Loiselle},
  journal= {arXiv preprint arXiv:2301.00884},
  year   = {2023}
}