基于极值寻求策略迭代的数据驱动 LQR
最优化与控制
2025-06-13 v3 系统与控制
系统与控制
摘要
本文提出一种名为 EXP-LQR 的新颖迭代算法,用于解决线性二次调节器(LQR)问题。EXP-LQR 的独特之处在于它仅需要获取与给定策略相关的截断近似无限时代价,因此无需直接获取系统和代价矩阵。具体而言,EXP-LQR 在每个迭代步骤中通过执行有限时间虚拟或实际实验来获取截断 LQR 代价,从而细化所维护的策略。这种扰动依据极值寻求机制进行,使整个算法成为一个时变非线性系统。我们采用 Lyapunov 方法结合平均值理论,展示 EXP-LQR 指数收敛于最优增益矩阵的一个任意小邻域。我们通过涵盖控制电动机的数值仿真来证明理论结果。
引用
@article{arxiv.2412.02758,
title = {Data-Driven LQR with Finite-Time Experiments via Extremum-Seeking Policy Iteration},
author = {Guido Carnevale and Nicola Mimmo and Giuseppe Notarstefano},
journal= {arXiv preprint arXiv:2412.02758},
year = {2025}
}