中文

重新审视 Peng 的 Q($\lambda$) 用于现代强化学习

机器学习 2021-03-02 v1 人工智能 机器学习

摘要

离轨多步强化学习算法包括保守与非保守两类:前者主动截断轨迹,而后者不截断。最近,Munos 等人(2016)证明了保守算法收敛到最优 Q 函数。相比之下,非保守算法被认为是不安全的,且理论保证有限或没有。尽管如此,近期研究表明非保守算法在经验上优于保守算法。受经验结果和理论缺失的驱动,我们对 Peng 的 Q(λ\lambda)(非保守算法的代表性例子)进行理论分析。我们证明,只要行为策略以类似于保守策略迭代的方式缓慢跟踪贪婪策略,它也收敛到最优策略。这一结果曾被猜想为真但尚未被证明。我们还在复杂连续控制任务中用 Peng 的 Q(λ\lambda) 进行实验,证实尽管其简单,Peng 的 Q(λ\lambda) 常优于保守算法。这些结果表明,被认为不安全的 Peng 的 Q(λ\lambda) 是一种理论可靠且实践有效的算法。

关键词

引用

@article{arxiv.2103.00107,
  title  = {Revisiting Peng's Q($\lambda$) for Modern Reinforcement Learning},
  author = {Tadashi Kozuno and Yunhao Tang and Mark Rowland and Rémi Munos and Steven Kapturowski and Will Dabney and Michal Valko and David Abel},
  journal= {arXiv preprint arXiv:2103.00107},
  year   = {2021}
}

备注

26 pages, 7 figures, 2 tables