中文

策略梯度与软 Q 学习等价性的一个简短变分证明

机器学习 2017-12-27 v1

摘要

两类主要的强化学习算法,Q-learning 与策略梯度,最近被证明在一方面使用 softmax 松弛、另一方面使用熵正则化时是等价的。我们将此结果与著名的 Shannon 熵和 softmax 函数的凸对偶性联系起来。该结果也称为 Donsker-Varadhan 公式。这给出了等价性的一个简短证明。我们随后进一步解释该对偶性,并利用凸分析的思想证明了一个关于软 Q 学习的新策略不等式。

关键词

引用

@article{arxiv.1712.08650,
  title  = {A short variational proof of equivalence between policy gradients and soft Q learning},
  author = {Pierre H. Richemond and Brendan Maginnis},
  journal= {arXiv preprint arXiv:1712.08650},
  year   = {2017}
}