中文

策略梯度的变分推断

机器学习 2018-03-28 v2 人工智能 机器学习

摘要

受 Stein 变分推断与 Stein 变分策略梯度的开创性工作启发,我们推导了一种方法,通过\textit{显式}最小化 KL 散度以摊销方式从后验变分参数分布中生成样本以匹配目标分布。随后,我们将该变分推断技术应用于带有贝叶斯神经网络参数化的 vanilla 策略梯度、TRPO 和 PPO,用于强化学习问题。

关键词

引用

@article{arxiv.1802.07833,
  title  = {Variational Inference for Policy Gradient},
  author = {Tianbing Xu},
  journal= {arXiv preprint arXiv:1802.07833},
  year   = {2018}
}

备注

7 pages