中文

从滚动时域策略梯度视角重访 LQR 控制

最优化与控制 2024-02-02 v3 人工智能 机器学习 系统与控制 系统与控制

摘要

本文从滚动时域策略梯度(RHPG)的视角重访离散时间线性二次调节器(LQR)问题,RHPG 是一种新近发展的用于控制应用的无模型学习框架。我们为 RHPG 提供了细粒度的样本复杂度分析,以学习一个既稳定又 ϵ\epsilon-接近最优 LQR 解的控制策略,且我们的算法不需要已知稳定控制策略用于初始化。结合 RHPG 近期在学习卡尔曼滤波器中的应用,我们展示了 RHPG 在线性控制与估计中具有通用适用性,并辅以精简的分析。

关键词

引用

@article{arxiv.2302.13144,
  title  = {Revisiting LQR Control from the Perspective of Receding-Horizon Policy Gradient},
  author = {Xiangyuan Zhang and Tamer Başar},
  journal= {arXiv preprint arXiv:2302.13144},
  year   = {2024}
}