中文

使用策略梯度方法实现无模型马尔可夫跳变线性二次控制的全局收敛

机器学习 2021-12-01 v1 最优化与控制

摘要

由于近年来对强化学习的兴趣增长,基于梯度的策略控制方法在控制问题中也日益流行。这是理所当然的,因为梯度策略方法具有以端到端方式优化关注指标的优势,且相对易于在无需底层系统完整知识的情况下实现。本文中,我们研究用于离散时间无模型马尔可夫跳变线性系统(MJLS)二次控制的基于梯度的策略优化方法的全局收敛性。我们克服了由多个状态耦合以及缺乏系统动力学知识所引起的众多挑战,并证明了使用梯度下降与自然策略梯度方法的策略的全局收敛性。我们还提供了仿真研究以佐证我们的结论。

关键词

引用

@article{arxiv.2111.15228,
  title  = {Global Convergence Using Policy Gradient Methods for Model-free Markovian Jump Linear Quadratic Control},
  author = {Santanu Rathod and Manoj Bhadu and Abir De},
  journal= {arXiv preprint arXiv:2111.15228},
  year   = {2021}
}

备注

42 pages, 3 figures