中文

基于 NMPC 与策略梯度迈向安全强化学习:第二部分——确定性情形

系统与控制 2024-09-23 v1 系统与控制

摘要

本文提出一种当最优策略由参数化优化问题近似、并通过硬约束施加安全性时,使用 actor-critic 技术部署确定性策略梯度方法的方法论。对于连续输入空间,对部署确定性策略梯度方法所需的探索施加安全限制会带来一些技术困难,我们在此予以解决。我们将特别研究基于鲁棒非线性模型预测控制(NMPC)的策略近似,其中安全性可被显式处理。为简洁起见,我们将仅在鲁棒线性 MPC 背景下详述安全方案的构建。推广到非线性情形是可能的但更为复杂。我们还将提出一种在鲁棒线性 MPC 背景下于整个学习过程中维持系统安全的技术。本文有一篇探讨随机策略梯度情形的姊妹篇。

关键词

引用

@article{arxiv.1906.04034,
  title  = {Towards Safe Reinforcement Learning Using NMPC and Policy Gradients: Part II - Deterministic Case},
  author = {Sebastien Gros and Mario Zanon},
  journal= {arXiv preprint arXiv:1906.04034},
  year   = {2024}
}