带强调权重的离策略 Actor-Critic
机器学习
2023-04-17 v3
摘要
由于策略梯度定理提供了梯度的简化形式,存在多种理论可靠的处理同策略设置的策略梯度算法。然而,由于存在多个目标且缺乏显式的离策略策略梯度定理,离策略设置一直不够清晰。在本工作中,我们将这些目标统一为一个离策略目标,并针对该统一目标给出策略梯度定理。推导涉及强调权重与兴趣函数。我们展示了多种近似梯度的策略,用于一种称为带强调权重的 Actor-Critic(ACE)的算法中。我们在一个反例中证明,先前的(半梯度)离策略 actor-critic 方法——特别是 Off-Policy Actor-Critic (OffPAC) 与 Deterministic Policy Gradient (DPG)——收敛到错误解,而 ACE 找到最优解。我们也强调了这些半梯度方法在实践中仍表现良好的原因,并提出了 ACE 中方差缩减的策略。我们在两个经典控制环境与一个旨在阐明各梯度近似所权衡取舍的基于图像的环境上,对 ACE 的若干变体进行了实证研究。我们发现,通过直接近似强调权重,ACE 在所有测试设置中表现与 OffPAC 相当或更好。
引用
@article{arxiv.2111.08172,
title = {Off-Policy Actor-Critic with Emphatic Weightings},
author = {Eric Graves and Ehsan Imani and Raksha Kumaraswamy and Martha White},
journal= {arXiv preprint arXiv:2111.08172},
year = {2023}
}
备注
63 pages