估计或通过随机神经元传播梯度以实现条件计算
机器学习
2013-08-16 v1
摘要
随机神经元和硬非线性在深度学习模型中因多种原因而有用,但在许多情况下它们提出了一个挑战性难题:如何估计损失函数相对于此类随机或非平滑神经元输入的梯度?即,我们能否通过这些随机神经元进行“反向传播”?我们考察了这一问题及现有方法,并比较了适用于不同场景的四类解决方案。其中一类是针对随机二元神经元的最小方差无偏梯度估计器(REINFORCE 算法的一个特例)。第二种方法(本文引入)将二元随机神经元的操作分解为随机二元部分和平滑可微部分,后者在一阶近似下逼近纯随机二元神经元的期望效应。第三种方法涉及在原本可微的计算图中注入加性或乘性噪声。第四种方法启发式地将相对于随机输出的梯度直接复制为相对于 sigmoid 参数的梯度估计器(我们称之为 straight-through 估计器)。为了探索这些估计器有用的情境,我们考虑了小规模的{\em 条件计算},其中稀疏随机单元构成了门控器的分布式表示,这些门控器能以组合方式关闭神经网络其余部分执行的大量计算块。在这种情况下,门控单元大部分时间产生实际的 0 至关重要。由此产生的稀疏性有望被利用,以大幅降低条件计算有用的大型深度网络的计算成本。
引用
@article{arxiv.1308.3432,
title = {Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation},
author = {Yoshua Bengio and Nicholas Léonard and Aaron Courville},
journal= {arXiv preprint arXiv:1308.3432},
year = {2013}
}
备注
arXiv admin note: substantial text overlap with arXiv:1305.2982