中文

马尔可夫跳跃线性系统策略优化方法的收敛性保证

最优化与控制 2020-02-12 v1 机器学习 系统与控制 系统与控制

摘要

近来,由于对强化学习兴趣的日益增长,用于控制目的的策略优化重新受到关注。本文中,我们研究马尔可夫跳跃线性系统 (MJLS) 二次控制的策略优化收敛性。首先,我们研究 MJLS 直接策略优化的优化地形,特别地,证明尽管所得问题非凸,其唯一驻点是全局最优解。接下来,我们证明若初始化于一个在均方意义下稳定闭环动态的控制器,Gauss-Newton 方法与自然策略梯度方法以线性速率收敛到 MJLS 的最优状态反馈控制器。我们提出一种新颖的 Lyapunov 论证以修复收敛证明中的一个关键稳定性问题。最后,我们给出一个数值例子以支持我们的理论。我们的工作为理解策略学习方法在控制未知 MJLS 上的性能提供了新见解。

关键词

引用

@article{arxiv.2002.04090,
  title  = {Convergence Guarantees of Policy Optimization Methods for Markovian Jump Linear Systems},
  author = {Joao Paulo Jansch-Porto and Bin Hu and Geir Dullerud},
  journal= {arXiv preprint arXiv:2002.04090},
  year   = {2020}
}

备注

Accepted to ACC 2020