从滚动时域策略梯度视角重访 LQR 控制
最优化与控制
2024-02-02 v3 人工智能
机器学习
系统与控制
系统与控制
摘要
本文从滚动时域策略梯度(RHPG)的视角重访离散时间线性二次调节器(LQR)问题,RHPG 是一种新近发展的用于控制应用的无模型学习框架。我们为 RHPG 提供了细粒度的样本复杂度分析,以学习一个既稳定又 -接近最优 LQR 解的控制策略,且我们的算法不需要已知稳定控制策略用于初始化。结合 RHPG 近期在学习卡尔曼滤波器中的应用,我们展示了 RHPG 在线性控制与估计中具有通用适用性,并辅以精简的分析。
引用
@article{arxiv.2302.13144,
title = {Revisiting LQR Control from the Perspective of Receding-Horizon Policy Gradient},
author = {Xiangyuan Zhang and Tamer Başar},
journal= {arXiv preprint arXiv:2302.13144},
year = {2024}
}