策略梯度与软 Q 学习等价性的一个简短变分证明
机器学习
2017-12-27 v1
摘要
两类主要的强化学习算法,Q-learning 与策略梯度,最近被证明在一方面使用 softmax 松弛、另一方面使用熵正则化时是等价的。我们将此结果与著名的 Shannon 熵和 softmax 函数的凸对偶性联系起来。该结果也称为 Donsker-Varadhan 公式。这给出了等价性的一个简短证明。我们随后进一步解释该对偶性,并利用凸分析的思想证明了一个关于软 Q 学习的新策略不等式。
引用
@article{arxiv.1712.08650,
title = {A short variational proof of equivalence between policy gradients and soft Q learning},
author = {Pierre H. Richemond and Brendan Maginnis},
journal= {arXiv preprint arXiv:1712.08650},
year = {2017}
}