中文

LQR 控制中的最优动态遗憾

机器学习 2022-06-22 v1 动力系统 最优化与控制 机器学习

摘要

我们研究具有二次损失序列的非随机控制问题,即 LQR 控制。我们提出了一种高效的在线算法,该算法实现了 O~(max{n1/3TV(M1:n)2/3,1})\tilde{O}(\text{max}\{n^{1/3} \mathcal{TV}(M_{1:n})^{2/3}, 1\}) 的最优动态(策略)遗憾,其中 TV(M1:n)\mathcal{TV}(M_{1:n}) 是由 M1,...,MnM_1,...,M_n 参数化的任何扰动动作策略预言序列的总变差——该序列是事后选择的,以适应未知的非平稳性。该速率改进了针对一般凸损失已知的最佳速率 O~(n(TV(M1:n)+1))\tilde{O}(\sqrt{n (\mathcal{TV}(M_{1:n})+1)} ),并且我们证明了它对于 LQR 是信息论最优的。主要技术组件包括将 LQR 归约为具有延迟反馈的在线线性回归(归功于 Foster 和 Simchowitz (2020)),以及一种新的适当学习算法,该算法在一系列“小批量”二次损失上具有最优的 O~(n1/3)\tilde{O}(n^{1/3}) 动态遗憾,这可能具有独立的研究价值。

关键词

引用

@article{arxiv.2206.09257,
  title  = {Optimal Dynamic Regret in LQR Control},
  author = {Dheeraj Baby and Yu-Xiang Wang},
  journal= {arXiv preprint arXiv:2206.09257},
  year   = {2022}
}