中文

策略梯度方法如何受控制极限的影响

最优化与控制 2022-06-15 v1 机器学习

摘要

我们从控制理论局限性的角度研究随机策略梯度方法。我们的主要结果是,在 Doyle 意义下病态的线性系统不可避免地导致有噪声的梯度估计。我们还给出一类稳定系统的例子,其中策略梯度方法遭受维数灾难。我们的结果适用于状态反馈和部分观测系统。

关键词

引用

@article{arxiv.2206.06863,
  title  = {How are policy gradient methods affected by the limits of control?},
  author = {Ingvar Ziemann and Anastasios Tsiamis and Henrik Sandberg and Nikolai Matni},
  journal= {arXiv preprint arXiv:2206.06863},
  year   = {2022}
}