中文

连续时间混合 $\mathcal{H}_2/\mathcal{H}_\infty$ 随机控制中的鲁棒策略优化

系统与控制 2023-06-30 v3 系统与控制

摘要

继近期为具有连续状态和动作空间的复杂动力系统基于强化学习(RL)的策略优化(PO)建立线性控制理论基准的复兴之后,本文针对具有加性布朗运动的连续时间无限维线性随机系统的最优控制问题,以状态、输入和扰动项的二次型指数为代价进行优化。我们给出了一种基于模型的以及无模型的 RL 随机 PO 算法。对于基于模型的算法,我们建立了严格的收敛保证。对于基于采样的算法,在源自相空间的轨迹弧上,我们发现 Hamilton-Jacobi-Bellman 方程参数化了轨迹代价——产生了一种离散时间(基于输入和状态)的采样方案,并伴有未知非线性动力学和连续时间策略迭代。已知动力学算子的需求被规避,我们得到一种强化 PO 算法(通过策略迭代),其中最小化 H2\mathcal{H}_2 范数的上界(以保证稳定性),并通过针对包含系统 HH_\infty 范数指定的噪声衰减水平的控制器最大化代价来实施鲁棒性度量。以输入到状态稳定性形式给出了严格的鲁棒性分析。我们的分析和贡献以许多以加性 Wiener 过程为特征的自然系统为区别,适用于动态博弈设定中的 \^Ito 随机微分微积分。

关键词

引用

@article{arxiv.2209.04477,
  title  = {Robust Policy Optimization in Continuous-time Mixed $\mathcal{H}_2/\mathcal{H}_\infty$ Stochastic Control},
  author = {Leilei Cui and Lekan Molu},
  journal= {arXiv preprint arXiv:2209.04477},
  year   = {2023}
}