中文

未知动力学下连续时间随机$H_\infty$控制问题的鲁棒策略迭代

最优化与控制 2024-10-02 v2

摘要

在本文中,我们基于强化学习技术研究了一个连续时间随机HH_\infty控制问题,该问题可视为求解一个随机线性二次两人零和微分博弈。首先,我们提出了一种强化学习算法,该算法可以在所有动态系统信息未知的情况下,基于收集的状态和控制数据迭代求解随机博弈代数Riccati方程。此外,该算法在迭代过程中只需收集一次数据。然后,我们分别讨论了策略迭代算法内环和外环的鲁棒性和收敛性,并表明当每次迭代的误差在一定范围内时,算法可以收敛到随机LQZSG问题鞍点的一个小邻域内。最后,我们将所提出的强化学习算法应用于两个仿真示例,以验证算法的有效性。

关键词

引用

@article{arxiv.2402.04721,
  title  = {Robust policy iteration for continuous-time stochastic $H_\infty$ control problem with unknown dynamics},
  author = {Zhongshi Sun and Guangyan Jia},
  journal= {arXiv preprint arXiv:2402.04721},
  year   = {2024}
}