中文

MR-ARL:用于鲁棒稳定同策略数据驱动 LQR 的模型参考自适应强化学习

系统与控制 2024-02-23 v1 系统与控制

摘要

本文介绍了一种用于数据驱动线性二次调节器 (LQR) 设计的新颖框架。首先,我们引入了一种用于同策略数据驱动 LQR 的强化学习范式,其中在保证包含被控对象和控制/学习动力学的整个闭环系统鲁棒稳定性的同时,同步执行探索与利用。随后,我们提出了模型参考自适应强化学习 (MR-ARL),这是一种整合了强化学习和模型参考自适应控制工具的控制架构。该方法基于一个包含当前识别值函数的可变参考模型。接着,使用自适应稳定器来确保所应用策略收敛至最优策略、被控对象收敛至最优参考模型,以及整体的鲁棒闭环稳定性。所提出的框架提供了针对现实世界扰动(如测量噪声、被控对象非线性或缓慢变化参数)的理论鲁棒性证明。通过逼真的数值模拟验证了所提出架构的有效性。

关键词

引用

@article{arxiv.2402.14483,
  title  = {MR-ARL: Model Reference Adaptive Reinforcement Learning for Robustly Stable On-Policy Data-Driven LQR},
  author = {Marco Borghesi and Alessandro Bosso and Giuseppe Notarstefano},
  journal= {arXiv preprint arXiv:2402.14483},
  year   = {2024}
}