策略梯度与软Q学习之间的等价性
机器学习
2018-10-16 v4
摘要
无模型强化学习的两种主要方法是策略梯度方法和 -学习方法。-学习方法在有效时可以是高效且样本高效的,然而由于其估计的 -值经验上非常不准确,人们并不清楚它们为何有效。一种可能的部分解释是 -学习方法秘密地执行策略梯度更新:我们展示了在熵正则化强化学习设定下,-学习与策略梯度方法之间存在精确的等价性,即“软”(熵正则化)-学习完全等价于一种策略梯度方法。我们还指出了 -学习方法与自然策略梯度方法之间的联系。在实验中,我们探索了 -学习和策略梯度的熵正则化版本,发现它们在Atari基准上的表现与标准变体相当(或略好)。我们还通过构造一种不使用目标网络或 -贪婪探索时间表的 -学习方法,使其紧密匹配A3C的学习动态,从而表明该等价性在实际设定中成立。
引用
@article{arxiv.1704.06440,
title = {Equivalence Between Policy Gradients and Soft Q-Learning},
author = {John Schulman and Xi Chen and Pieter Abbeel},
journal= {arXiv preprint arXiv:1704.06440},
year = {2018}
}