中文

遗憾最优 LQR 控制

最优化与控制 2023-04-14 v2 机器学习 系统与控制 系统与控制

摘要

我们考虑无限时域 LQR 控制问题。受在线学习中竞争分析的启发,我们引入动态遗憾作为控制器设计准则,其定义为因果控制器(仅能访问过去扰动)的 LQR 代价与已知的支配所有其他控制器的全知控制器(还能访问未来扰动)的 LQR 代价之差。遗憾本身是扰动的函数,我们提议寻找一个因果控制器,使其在全部有界能量扰动上最小化最坏情况遗憾。所得控制器可解释为相对于能看到未来的最优非因果控制器保证最小遗憾。我们推导了状态空间设定下最优遗憾与遗憾最优控制器的显式公式。这些显式解通过证明遗憾最优控制问题可归约为可显式求解的 Nehari 扩展问题而获得。遗憾最优控制器被证明是线性的,并可表示为经典 H2H_2 状态反馈律与一个 nn 阶控制器(nn 为状态维数)之和,其构造仅需标准 LQR Riccati 方程与两个 Lyapunov 方程的解。在一系列对象上的仿真表明,遗憾最优控制器在 H2H_2HH_\infty 最优控制器之间良好地插值,且通常具有同时接近各自最优值的 H2H_2HH_\infty 代价。因此,遗憾最优控制器可作为控制系统设计的可行选择。

关键词

引用

@article{arxiv.2105.01244,
  title  = {Regret-Optimal LQR Control},
  author = {Oron Sabag and Gautam Goel and Sahin Lale and Babak Hassibi},
  journal= {arXiv preprint arXiv:2105.01244},
  year   = {2023}
}