重新审视 Peng 的 Q($\lambda$) 用于现代强化学习
机器学习
2021-03-02 v1 人工智能
机器学习
摘要
离轨多步强化学习算法包括保守与非保守两类:前者主动截断轨迹,而后者不截断。最近,Munos 等人(2016)证明了保守算法收敛到最优 Q 函数。相比之下,非保守算法被认为是不安全的,且理论保证有限或没有。尽管如此,近期研究表明非保守算法在经验上优于保守算法。受经验结果和理论缺失的驱动,我们对 Peng 的 Q()(非保守算法的代表性例子)进行理论分析。我们证明,只要行为策略以类似于保守策略迭代的方式缓慢跟踪贪婪策略,它也收敛到最优策略。这一结果曾被猜想为真但尚未被证明。我们还在复杂连续控制任务中用 Peng 的 Q() 进行实验,证实尽管其简单,Peng 的 Q() 常优于保守算法。这些结果表明,被认为不安全的 Peng 的 Q() 是一种理论可靠且实践有效的算法。
引用
@article{arxiv.2103.00107,
title = {Revisiting Peng's Q($\lambda$) for Modern Reinforcement Learning},
author = {Tadashi Kozuno and Yunhao Tang and Mark Rowland and Rémi Munos and Steven Kapturowski and Will Dabney and Michal Valko and David Abel},
journal= {arXiv preprint arXiv:2103.00107},
year = {2021}
}
备注
26 pages, 7 figures, 2 tables