基于 Barrier-Lyapunov Actor-Critic 方法的稳定安全强化学习
系统与控制
2023-10-02 v3 机器学习
机器人学
系统与控制
摘要
强化学习(RL)在视频游戏和机器人等多个领域展现了令人印象深刻的性能。然而,从控制视角看,确保安全和稳定性这两个关键属性,在使用 RL 控制真实世界系统时仍是一项重大挑战。在本文中,我们首先给出 RL 系统的安全性和稳定性的定义,然后将控制障碍函数(CBF)和控制 Lyapunov 函数(CLF)方法与 RL 中的 actor-critic 方法相结合,提出一种 Barrier-Lyapunov Actor-Critic(BLAC)框架,该框架有助于维持系统的上述安全性和稳定性。在该框架中,基于从回放缓冲区采样的数据构建用于安全性的 CBF 约束和用于稳定性的 CLF 约束,并使用增广拉格朗日方法更新基于 RL 的控制器参数。此外,当安全性和稳定性约束无法同时满足而基于 RL 的控制器无法提供有效控制信号时,引入了一个额外的备份控制器。仿真结果表明,与基线算法相比,该框架产生的控制器能够帮助系统接近期望状态,并减少安全约束的违反次数。
引用
@article{arxiv.2304.04066,
title = {Stable and Safe Reinforcement Learning via a Barrier-Lyapunov Actor-Critic Approach},
author = {Liqun Zhao and Konstantinos Gatsis and Antonis Papachristodoulou},
journal= {arXiv preprint arXiv:2304.04066},
year = {2023}
}
备注
Accepted by IEEE CDC 2023