穿越虚空的反向传播:优化黑盒梯度估计的控制变量
机器学习
2018-02-27 v3
摘要
基于梯度的优化是深度学习和强化学习的基础。即使被优化的机制未知或不可微,使用高方差或有偏梯度估计的优化往往仍是最佳策略。我们引入了一个通用框架,用于学习随机变量黑盒函数的低方差、无偏梯度估计器。我们的方法使用与模型参数或策略联合训练的神经网络梯度,并适用于离散和连续设置。我们展示了该框架用于训练离散潜变量模型。我们还给出了优势 actor-critic 强化学习算法的一个无偏、动作条件扩展。
引用
@article{arxiv.1711.00123,
title = {Backpropagation through the Void: Optimizing control variates for black-box gradient estimation},
author = {Will Grathwohl and Dami Choi and Yuhuai Wu and Geoffrey Roeder and David Duvenaud},
journal= {arXiv preprint arXiv:1711.00123},
year = {2018}
}
备注
Published at ICLR 2018