中文

基于离策强化学习的 Itô 随机系统无模型 $H_{\infty}$ 控制

最优化与控制 2024-03-08 v1

摘要

针对系统模型未知的线性随机 Itô 系统,研究了随机 HH_{\infty} 控制问题。线性随机 HH_{\infty} 控制问题已知可转化为求解所谓的广义代数 Riccati 方程 (GARE),这是一个通常难以解析求解的非线性方程。更糟糕的是,当准确的系统模型不可用或在现实中构建成本过高时,无法利用基于模型的技术来近似求解 GARE。为解决这些问题,提出了一种离策强化学习 (RL) 方法,从真实系统数据而非系统模型中学习 GARE 的解;证明了其收敛性,并研究了 RL 对学习过程中误差的鲁棒性。在离策 RL 方法中,系统数据可由行为策略而非目标策略生成,这在实际系统应用中具有重要意义和前景。最后,在随机线性 F-16 飞机系统上验证了所提出的离策 RL 方法。

关键词

引用

@article{arxiv.2403.04412,
  title  = {Model-free $H_{\infty}$ control of It\^o stochastic system via off-policy reinforcement learning},
  author = {Jing Guo Jing Guo and Xiushan Jiang and Weihai Zhang},
  journal= {arXiv preprint arXiv:2403.04412},
  year   = {2024}
}