中文

离策略演员-评论家算法

机器学习 2015-03-20 v5

摘要

本文提出了第一个用于离策略强化学习的演员-评论家算法。我们的算法是在线的和增量的,其每时间步的复杂度与学习权重的数量呈线性关系。先前关于演员-评论家算法的工作仅限于在策略设置,并未利用离策略梯度时序差分学习的最新进展。离策略技术(如Greedy-GQ)使得可以在遵循另一个(行为)策略并从中获取数据的同时学习目标策略。然而,对于许多问题,演员-评论家方法比动作值方法(如Greedy-GQ)更实用,因为它们显式地表示策略;因此,策略可以是随机的并利用大的动作空间。在本文中,我们说明了如何实际地将离策略学习的通用性和学习潜力与演员-评论家方法在动作选择上的灵活性结合起来。我们推导出一个增量的、线性时间和空间复杂度的算法,包括资格迹,在类似于先前离策略算法的假设下证明收敛,并在标准强化学习基准问题上经验性地显示出比现有算法更好或相当的性能。

关键词

引用

@article{arxiv.1205.4839,
  title  = {Off-Policy Actor-Critic},
  author = {Thomas Degris and Martha White and Richard S. Sutton},
  journal= {arXiv preprint arXiv:1205.4839},
  year   = {2015}
}

备注

Full version of the paper, appendix and errata included; Proceedings of the 2012 International Conference on Machine Learning