策略梯度方法如何受控制极限的影响
最优化与控制
2022-06-15 v1 机器学习
摘要
我们从控制理论局限性的角度研究随机策略梯度方法。我们的主要结果是,在 Doyle 意义下病态的线性系统不可避免地导致有噪声的梯度估计。我们还给出一类稳定系统的例子,其中策略梯度方法遭受维数灾难。我们的结果适用于状态反馈和部分观测系统。
引用
@article{arxiv.2206.06863,
title = {How are policy gradient methods affected by the limits of control?},
author = {Ingvar Ziemann and Anastasios Tsiamis and Henrik Sandberg and Nikolai Matni},
journal= {arXiv preprint arXiv:2206.06863},
year = {2022}
}