中文

马尔可夫跳变线性二次控制的策略优化:基于梯度的方法与全局收敛性

最优化与控制 2020-11-25 v1 机器学习 系统与控制 系统与控制

摘要

近来,由于对强化学习兴趣的日益增长,用于控制的策略优化重新受到关注。本文研究离散时间马尔可夫跳变线性系统(MJLS)二次最优控制的基于梯度的策略优化方法的全局收敛性。首先,我们研究 MJLS 直接策略优化的优化地形,采用静态状态反馈控制器和二次性能代价。尽管所得问题非凸,我们仍能识别若干有用性质,如强制性、梯度主导性和几乎光滑性。基于这些性质,我们展示了三类策略优化方法的全局收敛性:梯度下降法、高斯-牛顿法和自然策略梯度法。我们证明,若以均方稳定的控制器初始化,这三种方法均以线性速率收敛到 MJLS 的最优状态反馈控制器。给出了若干数值例子以支持该理论。本工作为理解策略梯度方法在马尔可夫跳变线性二次控制问题上的性能提供了新见解。

关键词

引用

@article{arxiv.2011.11852,
  title  = {Policy Optimization for Markovian Jump Linear Quadratic Control: Gradient-Based Methods and Global Convergence},
  author = {Joao Paulo Jansch-Porto and Bin Hu and Geir Dullerud},
  journal= {arXiv preprint arXiv:2011.11852},
  year   = {2020}
}