基于离策强化学习的 Itô 随机系统无模型 $H_{\infty}$ 控制
最优化与控制
2024-03-08 v1
摘要
针对系统模型未知的线性随机 Itô 系统,研究了随机 控制问题。线性随机 控制问题已知可转化为求解所谓的广义代数 Riccati 方程 (GARE),这是一个通常难以解析求解的非线性方程。更糟糕的是,当准确的系统模型不可用或在现实中构建成本过高时,无法利用基于模型的技术来近似求解 GARE。为解决这些问题,提出了一种离策强化学习 (RL) 方法,从真实系统数据而非系统模型中学习 GARE 的解;证明了其收敛性,并研究了 RL 对学习过程中误差的鲁棒性。在离策 RL 方法中,系统数据可由行为策略而非目标策略生成,这在实际系统应用中具有重要意义和前景。最后,在随机线性 F-16 飞机系统上验证了所提出的离策 RL 方法。
引用
@article{arxiv.2403.04412,
title = {Model-free $H_{\infty}$ control of It\^o stochastic system via off-policy reinforcement learning},
author = {Jing Guo Jing Guo and Xiushan Jiang and Weihai Zhang},
journal= {arXiv preprint arXiv:2403.04412},
year = {2024}
}