高效学习线性二次调节器的对数后悔界
机器学习
2020-07-03 v2 机器学习
摘要
我们考虑转移参数初始未知的线性二次控制系统中的学习问题。该设定下近期结果已展示具有随决策步数平方根增长的后悔值的高效学习算法。我们提出新的高效算法,令人惊讶地实现了仅随步数(poly)对数缩放的后悔值,适用于两种场景:仅状态转移矩阵未知,以及仅状态-动作转移矩阵未知且最优策略满足某非退化条件。另一方面,我们给出下界表明当后一条件被破坏时,平方根后悔不可避免。
引用
@article{arxiv.2002.08095,
title = {Logarithmic Regret for Learning Linear Quadratic Regulators Efficiently},
author = {Asaf Cassel and Alon Cohen and Tomer Koren},
journal= {arXiv preprint arXiv:2002.08095},
year = {2020}
}
备注
Accepted for presentation at International Conference on Machine Learning (ICML) 2020