中文

用于线性随机系统自适应最优平稳控制的强化学习

系统与控制 2021-12-07 v3 机器学习 系统与控制 最优化与控制

摘要

本文研究带有加性和乘性噪声的连续时间线性随机系统的自适应最优平稳控制,采用强化学习技术。基于策略迭代,提出了一种新颖的离策略强化学习算法,称为基于乐观最小二乘的策略迭代,该算法能够直接从输入/状态数据出发,在不必显式辨识任何系统矩阵的情况下,从初始 admissible 控制策略开始迭代地求得自适应最优平稳控制问题的近最优策略。所提基于乐观最小二乘的策略迭代给出的解在温和条件下被证明以概率一收敛到最优解的小邻域内。将该算法应用于三重倒立摆实例,验证了其可行性与有效性。

关键词

引用

@article{arxiv.2107.07788,
  title  = {Reinforcement Learning for Adaptive Optimal Stationary Control of Linear Stochastic Systems},
  author = {Bo Pang and Zhong-Ping Jiang},
  journal= {arXiv preprint arXiv:2107.07788},
  year   = {2021}
}

备注

10 pages, 3 figures