一种用于自动驾驶车辆运动控制的安全强化学习驱动变权重模型预测控制
机器人学
2024-02-06 v1 人工智能
机器学习
系统与控制
系统与控制
摘要
确定模型预测控制(MPC)的最优代价函数参数以优化多个控制目标是一项具有挑战性且耗时的任务。多目标贝叶斯优化(BO)技术通过为具有静态权重的 MPC 确定帕累托最优参数集来解决此问题。然而,当 MPC 运行条件的上下文在操作过程中发生变化时,单一参数集可能无法提供最优的闭环控制性能,从而迫切需要运行时自适应代价函数权重。深度强化学习(RL)算法可以自动学习依赖于上下文的最优参数集,并动态适应变权重 MPC(WMPC)。然而,在连续动作空间中从头学习代价函数权重可能导致不安全的操作状态。为解决这一问题,我们提出了一种新方法,将 RL 动作限制在一个安全学习空间内,该空间代表了一组预优化的 BO 帕累托最优权重集目录。我们设计了一个 RL 智能体,使其不在连续空间中学习,而是主动预测即将到来的控制任务,并选择最优的离散动作,每个动作对应于一组依赖于上下文的帕累托最优权重。因此,即使是未经训练的 RL 智能体也能保证安全且最优的性能。实验结果表明,未经训练的 RL-WMPC 显示出帕累托最优的闭环行为,而训练 RL-WMPC 有助于展现出超越帕累托前沿的性能。
引用
@article{arxiv.2402.02624,
title = {A Safe Reinforcement Learning driven Weights-varying Model Predictive Control for Autonomous Vehicle Motion Control},
author = {Baha Zarrouki and Marios Spanakakis and Johannes Betz},
journal= {arXiv preprint arXiv:2402.02624},
year = {2024}
}