使用强调权重的离策略策略梯度定理
机器学习
2019-06-21 v2 机器学习
摘要
策略梯度方法被广泛用于强化学习中的控制,特别是连续动作设置。由于策略梯度定理提供了梯度的简化形式,已有大量针对同策略设置的理论严谨算法被提出。然而,在离策略学习中,其行为策略未必试图学习并遵循给定任务的最优策略,此类定理一直难以确立。在这项工作中,我们通过给出首个离策略策略梯度定理解决了这一开放问题。推导的关键在于使用 。我们开发了一种新的 actor-critic 算法称为带强调权重的 Actor-Critic (ACE)来近似该定理提供的简化梯度。我们在一个简单反例中证明,先前的离策略策略梯度方法特别是 OffPAC 和 DPG收敛到错误解,而 ACE 找到了最优解。
引用
@article{arxiv.1811.09013,
title = {An Off-policy Policy Gradient Theorem Using Emphatic Weightings},
author = {Ehsan Imani and Eric Graves and Martha White},
journal= {arXiv preprint arXiv:1811.09013},
year = {2019}
}
备注
Updated to final NeurIPS version