中文

穿越虚空的反向传播:优化黑盒梯度估计的控制变量

机器学习 2018-02-27 v3

摘要

基于梯度的优化是深度学习和强化学习的基础。即使被优化的机制未知或不可微,使用高方差或有偏梯度估计的优化往往仍是最佳策略。我们引入了一个通用框架,用于学习随机变量黑盒函数的低方差、无偏梯度估计器。我们的方法使用与模型参数或策略联合训练的神经网络梯度,并适用于离散和连续设置。我们展示了该框架用于训练离散潜变量模型。我们还给出了优势 actor-critic 强化学习算法的一个无偏、动作条件扩展。

关键词

引用

@article{arxiv.1711.00123,
  title  = {Backpropagation through the Void: Optimizing control variates for black-box gradient estimation},
  author = {Will Grathwohl and Dami Choi and Yuhuai Wu and Geoffrey Roeder and David Duvenaud},
  journal= {arXiv preprint arXiv:1711.00123},
  year   = {2018}
}

备注

Published at ICLR 2018