中文

马尔可夫决策过程的精炼策略改进界

机器学习 2021-07-20 v1 人工智能 最优化与控制

摘要

折扣回报之差的策略改进界在信赖域策略优化(TRPO)算法的理论依据中起着关键作用。现有界在折扣因子趋近于1时会导致退化的界,使得TRPO及相关算法在折扣因子接近1时的适用性存疑。我们精炼了\cite{Schulman2015, Achiam2017}中的结果,提出了一种在折扣因子上“连续”的新界。特别地,我们的界同样适用于具有长期平均回报的MDP。

关键词

引用

@article{arxiv.2107.08068,
  title  = {Refined Policy Improvement Bounds for MDPs},
  author = {J. G. Dai and Mark Gluzman},
  journal= {arXiv preprint arXiv:2107.08068},
  year   = {2021}
}

备注

Workshop on Reinforcement Learning Theory, ICML 2021