一类精确可解模型上策略梯度的研究
机器学习
2020-11-04 v1 概率论
摘要
策略梯度方法在强化学习中被广泛用作优化期望回报的手段。本文将一类特殊的精确可解POMDP(部分可观测马尔可夫决策过程)的策略参数演化建模为连续状态马尔可夫链,其转移概率由策略价值分布的梯度决定。我们的方法严重依赖随机游走理论,特别是仿射Weyl群。我们构造了一类具有可控探索难度的新型部分可观测环境,其中价值分布乃至策略参数演化均可解析推导。利用这些环境,我们分析了策略梯度向价值函数不同局部极大值的概率收敛性。据我们所知,这是首个针对此类环境的一类POMDP解析计算策略梯度景观的方法,从而对该问题的难度给出了有趣的见解。
引用
@article{arxiv.2011.01859,
title = {A Study of Policy Gradient on a Class of Exactly Solvable Models},
author = {Gavin McCracken and Colin Daniels and Rosie Zhao and Anna Brandenberger and Prakash Panangaden and Doina Precup},
journal= {arXiv preprint arXiv:2011.01859},
year = {2020}
}