中文

策略梯度与软Q学习之间的等价性

机器学习 2018-10-16 v4

摘要

无模型强化学习的两种主要方法是策略梯度方法和 QQ-学习方法。QQ-学习方法在有效时可以是高效且样本高效的,然而由于其估计的 QQ-值经验上非常不准确,人们并不清楚它们为何有效。一种可能的部分解释是 QQ-学习方法秘密地执行策略梯度更新:我们展示了在熵正则化强化学习设定下,QQ-学习与策略梯度方法之间存在精确的等价性,即“软”(熵正则化)QQ-学习完全等价于一种策略梯度方法。我们还指出了 QQ-学习方法与自然策略梯度方法之间的联系。在实验中,我们探索了 QQ-学习和策略梯度的熵正则化版本,发现它们在Atari基准上的表现与标准变体相当(或略好)。我们还通过构造一种不使用目标网络或 ϵ\epsilon-贪婪探索时间表的 QQ-学习方法,使其紧密匹配A3C的学习动态,从而表明该等价性在实际设定中成立。

关键词

引用

@article{arxiv.1704.06440,
  title  = {Equivalence Between Policy Gradients and Soft Q-Learning},
  author = {John Schulman and Xi Chen and Pieter Abbeel},
  journal= {arXiv preprint arXiv:1704.06440},
  year   = {2018}
}