中文

无备份控制器的连续时间非线性系统安全强化学习控制

系统与控制 2022-09-20 v1 系统与控制

摘要

本文提出一种在策略强化学习(RL)控制算法,该算法在用户定义的状态约束下解决一类不确定连续时间非线性系统的最优调节问题。我们将安全 RL 问题表述为在障碍 Lyapunov 函数(BLF)的时间导数约束下对哈密顿量的最小化。随后,我们利用该优化问题的解析解来修正 Actor-Critic-Identifier 架构,以安全地学习最优控制策略。所提方法不需要外部备份控制器的存在,且 RL 策略在整个过程中确保安全。所提控制器的有效性在一类欧拉-拉格朗日系统上得到验证。

关键词

引用

@article{arxiv.2209.08922,
  title  = {Safe reinforcement learning control for continuous-time nonlinear systems without a backup controller},
  author = {Soutrik Bandyopadhyay and Shubhendu Bhasin},
  journal= {arXiv preprint arXiv:2209.08922},
  year   = {2022}
}