中文

具 $\mathcal{H}_\infty$ 鲁棒性保证的 $\mathcal{H}_2$ 线性控制策略优化:隐式正则化与全局收敛

最优化与控制 2021-02-16 v3 机器学习 系统与控制 系统与控制

摘要

策略优化(PO)是强化学习(RL)的关键要素。对于控制设计,通常对待优化策略施加某些约束,以考虑系统的稳定性、鲁棒性或安全性问题。因此,PO 在大多数情况下本质上是一个约束(非凸)优化,其全局收敛一般难以分析。更重要的是,某些安全关键的约束,例如保证系统鲁棒性的 H\mathcal{H}_\infty 范数约束,在 PO 方法推进过程中难以强制实施。近来,策略梯度方法已被证明可收敛到线性二次调节器(LQR)——一个经典最优控制问题——的全局最优解,而无需将控制迭代正则化/投影到其(隐式)可行集即稳定集上。这一惊人结果建立在代价的强制性性质之上,确保迭代随代价下降保持可行。本文研究具 H\mathcal{H}_\infty 范数鲁棒性保证的 H2\mathcal{H}_2 线性控制 PO 的收敛理论。该问题一个显著的新特征是缺乏强制性,即代价在可行集边界附近可能取有限值,打破了已有的 LQR 分析。有趣的是,我们表明两种 PO 方法享有隐式正则化性质,即迭代如同被算法正则化一般保持 H\mathcal{H}_\infty 鲁棒性约束。此外,尽管问题非凸,我们表明这些算法以全局次线性速率收敛到全局最优策略,避开所有次优驻点/局部极小,并在一定条件下以局部(超)线性速率收敛。

关键词

引用

@article{arxiv.1910.09496,
  title  = {Policy Optimization for $\mathcal{H}_2$ Linear Control with $\mathcal{H}_\infty$ Robustness Guarantee: Implicit Regularization and Global Convergence},
  author = {Kaiqing Zhang and Bin Hu and Tamer Başar},
  journal= {arXiv preprint arXiv:1910.09496},
  year   = {2021}
}

备注

Addressed comments from L4DC and SICON; strengthened the landscape and global convergence results; added simulation comparisons with existing solvers to justify the numerical efficiency of our methods