中文

线性二次调节器近似策略迭代的有限时间分析

机器学习 2019-05-31 v1 最优化与控制 机器学习

摘要

我们研究了线性二次调节器(LQR)的近似策略迭代(PI)的样本复杂度,建立在近期以 LQR 为试验台理解强化学习(RL)算法在连续控制任务上局限的一系列工作之上。我们的分析量化了策略改进与策略评估之间的张力,并表明就样本复杂度而言策略评估是主导因素。具体而言,我们证明为获得一个与最优 LQR 控制器相差在 ε\varepsilon 之内的控制器,每一步策略评估至多需要 (n+d)3/ε2(n+d)^3/\varepsilon^2 个样本,其中 nn 为状态向量维度,dd 为输入向量维度。另一方面,仅需 log(1/ε)\log(1/\varepsilon) 步策略改进,从而总体样本复杂度为 (n+d)3ε2log(1/ε)(n+d)^3 \varepsilon^{-2} \log(1/\varepsilon)。我们进一步基于分析构建了一个简单的基于 ε\varepsilon-贪婪探索的自适应过程,其以近似 PI 为子程序并取得 T2/3T^{2/3} 后悔值,改进了 Abbasi-Yadkori 等人近期的结果。

关键词

引用

@article{arxiv.1905.12842,
  title  = {Finite-time Analysis of Approximate Policy Iteration for the Linear Quadratic Regulator},
  author = {Karl Krauth and Stephen Tu and Benjamin Recht},
  journal= {arXiv preprint arXiv:1905.12842},
  year   = {2019}
}