策略梯度的变分推断
机器学习
2018-03-28 v2 人工智能
机器学习
摘要
受 Stein 变分推断与 Stein 变分策略梯度的开创性工作启发,我们推导了一种方法,通过\textit{显式}最小化 KL 散度以摊销方式从后验变分参数分布中生成样本以匹配目标分布。随后,我们将该变分推断技术应用于带有贝叶斯神经网络参数化的 vanilla 策略梯度、TRPO 和 PPO,用于强化学习问题。
引用
@article{arxiv.1802.07833,
title = {Variational Inference for Policy Gradient},
author = {Tianbing Xu},
journal= {arXiv preprint arXiv:1802.07833},
year = {2018}
}
备注
7 pages