中文

风险约束 LQR 策略梯度原始对偶方法的全局收敛性

最优化与控制 2022-11-23 v2 系统与控制 系统与控制

摘要

尽管最优控制理论中的技术常基于模型,策略优化(PO)方法直接优化所关注的性能指标。尽管其已是强化学习问题的基本方法,关于其性能的理论认知却很有限。本文中,我们关注通过 PO 方法求解风险约束线性二次调节器(RC-LQR)问题,这需应对一个具有挑战性的非凸约束优化问题。为此,我们首先基于早前关于最优策略具有时不变仿射结构的结果,证明相关拉格朗日函数具有强制性、局部梯度支配性且拥有局部 Lipschitz 连续梯度,并据此建立强对偶性。随后,我们设计了在基于模型与基于样本两种设定下均具全局收敛保证的策略梯度原始对偶方法。最后,我们在仿真中利用系统轨迹样本验证了所提方法。

关键词

引用

@article{arxiv.2104.04901,
  title  = {Global Convergence of Policy Gradient Primal-dual Methods for Risk-constrained LQRs},
  author = {Feiran Zhao and Keyou You and Tamer Başar},
  journal= {arXiv preprint arXiv:2104.04901},
  year   = {2022}
}