线性二次调节器近似策略迭代的有限时间分析
机器学习
2019-05-31 v1 最优化与控制
机器学习
摘要
我们研究了线性二次调节器(LQR)的近似策略迭代(PI)的样本复杂度,建立在近期以 LQR 为试验台理解强化学习(RL)算法在连续控制任务上局限的一系列工作之上。我们的分析量化了策略改进与策略评估之间的张力,并表明就样本复杂度而言策略评估是主导因素。具体而言,我们证明为获得一个与最优 LQR 控制器相差在 之内的控制器,每一步策略评估至多需要 个样本,其中 为状态向量维度, 为输入向量维度。另一方面,仅需 步策略改进,从而总体样本复杂度为 。我们进一步基于分析构建了一个简单的基于 -贪婪探索的自适应过程,其以近似 PI 为子程序并取得 后悔值,改进了 Abbasi-Yadkori 等人近期的结果。
引用
@article{arxiv.1905.12842,
title = {Finite-time Analysis of Approximate Policy Iteration for the Linear Quadratic Regulator},
author = {Karl Krauth and Stephen Tu and Benjamin Recht},
journal= {arXiv preprint arXiv:1905.12842},
year = {2019}
}