基于拉格朗日的状态约束系统在线安全强化学习
系统与控制
2025-06-26 v2 系统与控制
摘要
本文提出一种安全强化学习(RL)算法,可近似求解连续时间不确定非线性系统的状态约束最优控制问题。我们将安全RL问题表述为包含代价泛函与编码状态约束的用户定义障碍李雅普诺夫函数(BLF)的拉格朗日量的最小化。我们证明由卡鲁什-库恩-塔克(KKT)条件得到的解析解包含一个拉格朗日乘子的状态依赖表达式,其为系统动力学中不确定项的函数。我们认为对拉格朗日乘子的朴素估计可能导致安全约束违反。为克服该挑战,我们提出执行者-评论者-辨识器-拉格朗日(ACIL)算法,该算法从在线数据学习最优控制策略而不损害安全性。我们给出了所提算法的安全性与有界性保证,并通过仿真研究将其性能与现有离线/在线RL方法比较。
引用
@article{arxiv.2305.12967,
title = {Lagrangian-based online safe reinforcement learning for state-constrained systems},
author = {Soutrik Bandyopadhyay and Shubhendu Bhasin},
journal= {arXiv preprint arXiv:2305.12967},
year = {2025}
}