中文

面向成本约束LQR的策略梯度方法:强对偶性与全局收敛性

最优化与控制 2024-06-07 v1 系统与控制 系统与控制

摘要

在安全关键应用中,强化学习(RL)需要考虑安全约束。然而,针对连续控制的约束RL的理论理解在很大程度上是缺失的。作为案例研究,本文提出了一种成本约束的LQR公式,其中多个具有用户定义惩罚矩阵的LQR成本受到约束。为解决该问题,我们提出了一种策略梯度原始-对偶方法来寻找最优状态反馈增益。尽管成本约束LQR问题具有非凸性,我们为强对偶性提供了一个构造性证明,并为最优乘子集提供了几何解释。通过证明凹对偶函数是Lipschitz光滑的,我们进一步为PG原始-对偶方法提供了收敛性保证。最后,我们进行了仿真以验证我们的理论发现。

关键词

引用

@article{arxiv.2406.03734,
  title  = {Policy Gradient Methods for the Cost-Constrained LQR: Strong Duality and Global Convergence},
  author = {Feiran Zhao and Keyou You},
  journal= {arXiv preprint arXiv:2406.03734},
  year   = {2024}
}