中文

无模型LQR的预言机复杂度降低:一种随机方差缩减策略梯度方法

最优化与控制 2023-09-20 v1 机器学习

摘要

我们研究通过随机方差缩减策略梯度(SVRPG)方法学习离散时间线性二次调节器(LQR)问题的ϵ\epsilon-近似解。尽管策略梯度方法已被证明能线性收敛到无模型LQR问题的最优解,但在梯度估计中大量需要两点代价查询可能是难以处理的,特别是在获取两个不同控制输入配置下的代价函数评估代价极高应用中。为此,我们提出了一种预言机高效方法。我们的方法在双循环方差缩减算法中结合了一点与两点估计。对于β(0,1)\beta \in (0,1),它仅以O(log(1/ϵ)β)O\left(\log\left(1/\epsilon\right)^{\beta}\right)的两点代价信息达到近似最优解。

关键词

引用

@article{arxiv.2309.10679,
  title  = {Oracle Complexity Reduction for Model-free LQR: A Stochastic Variance-Reduced Policy Gradient Approach},
  author = {Leonardo F. Toso and Han Wang and James Anderson},
  journal= {arXiv preprint arXiv:2309.10679},
  year   = {2023}
}