具有聚合状态的策略梯度方法的逼近优势
机器学习
2022-06-24 v3 最优化与控制
机器学习
摘要
坊间观点认为,与其同类方法近似策略迭代相比,策略梯度对错误设定更为鲁棒。本文研究状态聚合表示的情形,其中状态空间被划分,且策略或价值函数近似在划分块上保持恒定。本文证明一种策略梯度方法收敛到这样一个策略:其每期后悔值以 为界,其中 是属于同一划分块的状态-动作价值函数中两个元素的最大差值。在相同的表示下,近似策略迭代和近似价值迭代都可能产生每期后悔值随 缩放的策略,其中 是折扣因子。面对固有的近似误差,局部优化真实决策目标的方法可以更为鲁棒。
引用
@article{arxiv.2007.11684,
title = {Approximation Benefits of Policy Gradient Methods with Aggregated States},
author = {Daniel Russo},
journal= {arXiv preprint arXiv:2007.11684},
year = {2022}
}