一种求解连续时间LQR问题的高效离策略强化学习算法
系统与控制
2023-04-03 v1 机器学习
系统与控制
摘要
本文设计了一种离策略强化学习算法,仅利用从系统测得的输入-状态数据来求解连续时间LQR问题。与文献中的其他算法不同,我们提出在数据收集阶段使用一种特定的持续激励输入作为探索信号。接着我们证明,利用该持续激励数据,算法中矩阵方程的解在每次迭代中均保证存在且唯一。同时也证明了算法收敛到最优控制输入。此外,我们将策略评估步骤表述为Sylvester转置方程的解,从而提高了求解效率。最后,提出了一种仅利用测得数据确定稳定策略以初始化算法的方法。
引用
@article{arxiv.2303.17819,
title = {An Efficient Off-Policy Reinforcement Learning Algorithm for the Continuous-Time LQR Problem},
author = {Victor G. Lopez and Matthias A. Müller},
journal= {arXiv preprint arXiv:2303.17819},
year = {2023}
}
备注
7 pages