中文

基于输入-输出历史表示的 LQG 控制策略梯度法:收敛到 $O(\epsilon)$ - stationary 点

最优化与控制 2025-10-23 v1 系统与控制 系统与控制

摘要

我们研究了用于线性二次高斯 (LQG) 动态输出反馈控制问题的策略梯度方法 (PGM),其采用闭环系统的输入-输出历史 (IOH) 表示。首先,我们展示,任何动态输出反馈控制器都等价于针对以有限长度 IOH 表示的新系统的静态部分状态反馈增益。利用这一等价性,我们将寻找最优动态输出反馈控制器的搜索重新表述为针对相应部分状态反馈增益的优化问题。随后,我们引入一种松弛版本的 IOH 基于 LQG问题,通过向新系统加入协方差为 ϵI\epsilon I 的小过程噪声来确保其 coerciveness,这一条件是建立梯度基于收敛保证所必需的。因此,我们显示,针对松弛问题的基础 PGM 收敛于一个 O(ϵ)\mathcal{O}(\epsilon)-stationary 点,即满足 J(K)FO(ϵ)\|\nabla J(\overline{K})\|_F \leq \mathcal{O}(\epsilon)K\overline{K},其中 JJ 表示原始 LQG 成本。数值实验表明,收敛至全局最优 LQG 控制器的附近。

关键词

引用

@article{arxiv.2510.19141,
  title  = {Policy Gradient Method for LQG Control via Input-Output-History Representation: Convergence to $O(\epsilon)$-Stationary Points},
  author = {Tomonori Sadamoto and Takashi Tanaka},
  journal= {arXiv preprint arXiv:2510.19141},
  year   = {2025}
}