关于 Wasserstein 强化学习与 Fokker-Planck 方程
机器学习
2017-12-21 v1
摘要
策略梯度方法在策略变化被限制为较小的 Kullback-Leibler 散度时通常能获得更好的性能。我们推导了策略变化被限制为较小的 Wasserstein 距离(或信赖域)的策略梯度。这是在带有熵正则化的离散与连续多臂老虎机设定下完成的。我们表明,在关于 Wasserstein 距离 的小步长极限下,策略动力学由 Fokker-Planck(热)方程支配,遵循 Jordan-Kinderlehrer-Otto 结果。这意味着策略经历扩散和平流,聚集在具有高奖励的动作附近。这有助于阐明概率匹配设定中收敛的本质,并为诸如高斯策略先验与加性梯度噪声等经验做法提供合理性。
引用
@article{arxiv.1712.07185,
title = {On Wasserstein Reinforcement Learning and the Fokker-Planck equation},
author = {Pierre H. Richemond and Brendan Maginnis},
journal= {arXiv preprint arXiv:1712.07185},
year = {2017}
}