LQR 控制中的最优动态遗憾
机器学习
2022-06-22 v1 动力系统
最优化与控制
机器学习
摘要
我们研究具有二次损失序列的非随机控制问题,即 LQR 控制。我们提出了一种高效的在线算法,该算法实现了 的最优动态(策略)遗憾,其中 是由 参数化的任何扰动动作策略预言序列的总变差——该序列是事后选择的,以适应未知的非平稳性。该速率改进了针对一般凸损失已知的最佳速率 ,并且我们证明了它对于 LQR 是信息论最优的。主要技术组件包括将 LQR 归约为具有延迟反馈的在线线性回归(归功于 Foster 和 Simchowitz (2020)),以及一种新的适当学习算法,该算法在一系列“小批量”二次损失上具有最优的 动态遗憾,这可能具有独立的研究价值。
引用
@article{arxiv.2206.09257,
title = {Optimal Dynamic Regret in LQR Control},
author = {Dheeraj Baby and Yu-Xiang Wang},
journal= {arXiv preprint arXiv:2206.09257},
year = {2022}
}