中文

基于 MHE-MPC 的不确定多胞体 LPV 系统策略梯度强化学习

系统与控制 2022-06-13 v1 系统与控制

摘要

在本文中,我们针对具有不精确调度参数(作为具有不精确边界的外生信号)的多胞体线性参数变化(LPV)系统提出了一种基于学习的模型预测控制(MPC)方法,其中由调度参数组合捕获的线性时不变(LTI)模型(顶点)变得错误。我们首先提出采用移动时域估计(MHE)方案,基于观测值和模型匹配误差同时估计凸组合向量和未测量状态。为解决 MPC 和 MHE 方案中使用的错误 LTI 模型,我们随后采用策略梯度(PG)强化学习(RL)来学习估计器(MHE)和控制器(MPC),从而实现最佳的闭环性能。所提出的基于 RL 的 MHE/MPC 设计的有效性通过一个说明性示例得到验证。

关键词

引用

@article{arxiv.2206.05089,
  title  = {Policy Gradient Reinforcement Learning for Uncertain Polytopic LPV Systems based on MHE-MPC},
  author = {Hossein Nejatbakhsh Esfahani and Sebastien Gros},
  journal= {arXiv preprint arXiv:2206.05089},
  year   = {2022}
}