中文

使用强调权重的离策略策略梯度定理

机器学习 2019-06-21 v2 机器学习

摘要

策略梯度方法被广泛用于强化学习中的控制,特别是连续动作设置。由于策略梯度定理提供了梯度的简化形式,已有大量针对同策略设置的理论严谨算法被提出。然而,在离策略学习中,其行为策略未必试图学习并遵循给定任务的最优策略,此类定理一直难以确立。在这项工作中,我们通过给出首个离策略策略梯度定理解决了这一开放问题。推导的关键在于使用 emphaticemphatic weightingsweightings。我们开发了一种新的 actor-critic 算法\unicodex2014\unicode{x2014}称为带强调权重的 Actor-Critic (ACE)\unicodex2014\unicode{x2014}来近似该定理提供的简化梯度。我们在一个简单反例中证明,先前的离策略策略梯度方法\unicodex2014\unicode{x2014}特别是 OffPAC 和 DPG\unicodex2014\unicode{x2014}收敛到错误解,而 ACE 找到了最优解。

关键词

引用

@article{arxiv.1811.09013,
  title  = {An Off-policy Policy Gradient Theorem Using Emphatic Weightings},
  author = {Ehsan Imani and Eric Graves and Martha White},
  journal= {arXiv preprint arXiv:1811.09013},
  year   = {2019}
}

备注

Updated to final NeurIPS version