关于 LQG 问题的梯度支配
最优化与控制
2025-07-15 v1 机器学习
系统与控制
系统与控制
摘要
我们通过政策梯度(PG)方法考虑线性二次高斯(LQG)调节器问题的解决方案。尽管 PG 方法在解决线性二次调节器(LQR)问题时已展示出强大的理论保证,尽管其非凸景观,但其在 LQG 设置下的理论理解仍有限。值得注意的是,LQG 问题在经典参数化下缺乏梯度支配,即使用动态控制器,这会阻碍全局收敛保证。本文通过采用 LQG 控制器集合的另一种参数化方式并运用提升论证来研究 PG 方法。我们将这种参数化称为控制输入的历史表示,因为它由前 p 个时间步的历史输入和输出数据参数化。该表示使我们能够为 LQG 成本建立梯度支配和近似光滑性。我们证明了在基于模型和无模型设置下,PG-LQG 具有全局收敛和 per-迭代稳定性保证。提供在开环不稳定系统上的数值实验,以支持全局收敛保证并说明在不同历史长度下历史表示的收敛性。
引用
@article{arxiv.2507.09026,
title = {On the Gradient Domination of the LQG Problem},
author = {Kasra Fallah and Leonardo F. Toso and James Anderson},
journal= {arXiv preprint arXiv:2507.09026},
year = {2025}
}