中文

基于 NMPC 与策略梯度的安全强化学习初探:第一部分——随机情形

系统与控制 2024-09-23 v1 系统与控制

摘要

我们提出了一种在最优策略由参数化优化问题逼近时,使用 actor-critic 技术部署随机策略梯度方法的方法论,从而可通过硬约束强制安全性。对于连续输入空间,对随机策略施加安全限制会使对其密度的采样与评估变得困难。本文提出了一种计算高效的方法来解决该问题。我们将聚焦于基于鲁棒非线性模型预测控制(NMPC)的策略逼近,其中安全性可被显式处理。为简洁起见,我们将仅在鲁棒线性 MPC 背景下详述安全策略。推广至非线性情形是可能的但更为复杂。我们还将提出一种在鲁棒线性 MPC 背景下使系统在整个学习过程中保持安全的技术。本文有一篇讨论确定性策略梯度情形的姊妹篇。

关键词

引用

@article{arxiv.1906.04057,
  title  = {Towards Safe Reinforcement Learning Using NMPC and Policy Gradients: Part I - Stochastic case},
  author = {Sebastien Gros and Mario Zanon},
  journal= {arXiv preprint arXiv:1906.04057},
  year   = {2024}
}