中文

自适应信赖域策略优化:正则化 MDP 的全局收敛性与更快速率

机器学习 2019-12-13 v2 最优化与控制 机器学习

摘要

信赖域策略优化(TRPO)是强化学习(RL)中一种流行且在经验上成功的策略搜索算法,它迭代求解一个限制连续策略彼此“接近”的替代问题。然而,TRPO 一直被视为受保守策略迭代(CPI)启发的启发式算法。我们证明,TRPO 中使用的自适应缩放机制实际上是传统凸分析中信赖域方法的自然“RL 版本”。我们首先在规划设定下分析 TRPO,此时我们可以访问模型和整个状态空间。然后,我们考虑基于样本的 TRPO,并建立了到全局最优的 O~(1/N)\tilde O(1/\sqrt{N}) 收敛速率。重要的是,自适应缩放机制使我们能够在正则化 MDP 中分析 TRPO,并为其证明了 O~(1/N)\tilde O(1/N) 的快速率,这与凸优化中的结果非常相似。这是 RL 中首个关于正则化即时成本或奖励能带来更快速率的结果。

关键词

引用

@article{arxiv.1909.02769,
  title  = {Adaptive Trust Region Policy Optimization: Global Convergence and Faster Rates for Regularized MDPs},
  author = {Lior Shani and Yonathan Efroni and Shie Mannor},
  journal= {arXiv preprint arXiv:1909.02769},
  year   = {2019}
}

备注

Published at AAAI-2020 58 pages