刻画 Actor-Critic 与策略梯度之间的差距
人工智能
2021-06-15 v1 机器学习
摘要
Actor-critic(AC)方法在强化学习中无处不在。尽管人们理解 AC 方法与策略梯度(PG)密切相关,但二者精确的关联此前尚未被充分刻画。在本文中,我们通过确定对 AC 目标/梯度的精确调整来弥合 AC 与 PG 方法之间的差距,该调整可恢复累积奖励目标(PG)的真实策略梯度。此外,通过将 AC 方法视为 actor 与 critic 之间的双人 Stackelberg 博弈,我们表明 Stackelberg 策略梯度可作为我们更一般分析的一个特例被恢复。基于这些结果,我们开发了实用算法——残差 Actor-Critic 与 Stackelberg Actor-Critic,用于估计 AC 与 PG 之间的修正项,并据此修改标准 AC 算法。在流行的表格环境与连续环境中的实验表明,所提出的修正项能提升现有 AC 方法的样本效率与最终性能。
引用
@article{arxiv.2106.06932,
title = {Characterizing the Gap Between Actor-Critic and Policy Gradient},
author = {Junfeng Wen and Saurabh Kumar and Ramki Gummadi and Dale Schuurmans},
journal= {arXiv preprint arXiv:2106.06932},
year = {2021}
}
备注
ICML 2021