MR-ARL:用于鲁棒稳定同策略数据驱动 LQR 的模型参考自适应强化学习
系统与控制
2024-02-23 v1 系统与控制
摘要
本文介绍了一种用于数据驱动线性二次调节器 (LQR) 设计的新颖框架。首先,我们引入了一种用于同策略数据驱动 LQR 的强化学习范式,其中在保证包含被控对象和控制/学习动力学的整个闭环系统鲁棒稳定性的同时,同步执行探索与利用。随后,我们提出了模型参考自适应强化学习 (MR-ARL),这是一种整合了强化学习和模型参考自适应控制工具的控制架构。该方法基于一个包含当前识别值函数的可变参考模型。接着,使用自适应稳定器来确保所应用策略收敛至最优策略、被控对象收敛至最优参考模型,以及整体的鲁棒闭环稳定性。所提出的框架提供了针对现实世界扰动(如测量噪声、被控对象非线性或缓慢变化参数)的理论鲁棒性证明。通过逼真的数值模拟验证了所提出架构的有效性。
引用
@article{arxiv.2402.14483,
title = {MR-ARL: Model Reference Adaptive Reinforcement Learning for Robustly Stable On-Policy Data-Driven LQR},
author = {Marco Borghesi and Alessandro Bosso and Giuseppe Notarstefano},
journal= {arXiv preprint arXiv:2402.14483},
year = {2024}
}