中文

具有聚合状态的策略梯度方法的逼近优势

机器学习 2022-06-24 v3 最优化与控制 机器学习

摘要

坊间观点认为,与其同类方法近似策略迭代相比,策略梯度对错误设定更为鲁棒。本文研究状态聚合表示的情形,其中状态空间被划分,且策略或价值函数近似在划分块上保持恒定。本文证明一种策略梯度方法收敛到这样一个策略:其每期后悔值以 ϵ\epsilon 为界,其中 ϵ\epsilon 是属于同一划分块的状态-动作价值函数中两个元素的最大差值。在相同的表示下,近似策略迭代和近似价值迭代都可能产生每期后悔值随 ϵ/(1γ)\epsilon/(1-\gamma) 缩放的策略,其中 γ\gamma 是折扣因子。面对固有的近似误差,局部优化真实决策目标的方法可以更为鲁棒。

关键词

引用

@article{arxiv.2007.11684,
  title  = {Approximation Benefits of Policy Gradient Methods with Aggregated States},
  author = {Daniel Russo},
  journal= {arXiv preprint arXiv:2007.11684},
  year   = {2022}
}