马尔可夫决策过程的精炼策略改进界
机器学习
2021-07-20 v1 人工智能
最优化与控制
摘要
折扣回报之差的策略改进界在信赖域策略优化(TRPO)算法的理论依据中起着关键作用。现有界在折扣因子趋近于1时会导致退化的界,使得TRPO及相关算法在折扣因子接近1时的适用性存疑。我们精炼了\cite{Schulman2015, Achiam2017}中的结果,提出了一种在折扣因子上“连续”的新界。特别地,我们的界同样适用于具有长期平均回报的MDP。
引用
@article{arxiv.2107.08068,
title = {Refined Policy Improvement Bounds for MDPs},
author = {J. G. Dai and Mark Gluzman},
journal= {arXiv preprint arXiv:2107.08068},
year = {2021}
}
备注
Workshop on Reinforcement Learning Theory, ICML 2021