全随机梯度算法及其在强化学习中的应用
机器学习
2019-02-06 v1 人工智能
神经与进化计算
机器学习
摘要
反向传播与导数链式法则备受瞩目;然而全导数法则并未受到同等关注。本工作中,我们展示了全导数法则如何导向一种直观的视觉框架,用于在图模型上构造梯度估计量。特别地,先前的“策略梯度定理”可轻易推导得出。我们基于密度估计推导了新的梯度估计量,以及一种似然比梯度,其“跳跃”至中间节点而非直接指向目标函数。我们在基于模型的策略梯度算法上评估了我们的方法,取得了良好性能,并给出了有助于揭开流行算法PILCO成功之谜的证据。
引用
@article{arxiv.1902.01722,
title = {Total stochastic gradient algorithms and applications in reinforcement learning},
author = {Paavo Parmas},
journal= {arXiv preprint arXiv:1902.01722},
year = {2019}
}
备注
NeurIPS 2018