中文

基于策略梯度方法设计动态输出反馈控制器

系统与控制 2024-07-26 v2 系统与控制

摘要

本文提出用于离散时间部分可观测系统动态输出反馈控制器设计的基于模型与无模型的策略梯度方法(PGMs)。为实现此目标,我们首先证明任意动态输出反馈控制器设计等价于一个新引入系统的状态反馈控制器设计,该系统的内部状态为有限长度输入输出历史(IOH)。接着,基于此等价性,我们提出一种基于模型的 PGM,并通过证明 Polyak-Lojasiewicz 不等式对基于可达性的 IOH 动力学无损投影成立,展示其全局线性收敛性。此外,我们提出该 PGM 的两种无模型实现:多片段与单片段 PGM。前者是基于模型 PGM 的蒙特卡洛近似,而后者是前者的简化版本以便于在真实系统中使用。我们还给出了两种方法的样本复杂度分析。最后,通过数值仿真研究了基于模型/无模型 PGMs 的有效性。

关键词

引用

@article{arxiv.2210.09735,
  title  = {Policy Gradient Methods for Designing Dynamic Output Feedback Controllers},
  author = {Tomonori Sadamoto and Takumi Hirai},
  journal= {arXiv preprint arXiv:2210.09735},
  year   = {2024}
}

备注

Accepted in European Journal of Control