无模型学习线性二次调节器的在线策略梯度及其 $\sqrt{T}$ 后悔界
机器学习
2021-02-26 v1 机器学习
摘要
我们考虑在固定二次代价下学习控制线性动力系统的任务,即线性二次调节器(LQR)问题。尽管无模型方法在实践中往往更受青睐,但迄今为止仅有依赖昂贵系统辨识的基于模型的方法被证明能达到随最优时间范围 T 缩放的后悔(regret)。我们提出了首个达到类似后悔保证的无模型算法。我们的方法依赖于高效的策略梯度方案,以及对该设定下策略空间探索代价的全新更紧分析。
引用
@article{arxiv.2102.12608,
title = {Online Policy Gradient for Model Free Learning of Linear Quadratic Regulators with $\sqrt{T}$ Regret},
author = {Asaf Cassel and Tomer Koren},
journal= {arXiv preprint arXiv:2102.12608},
year = {2021}
}