中文

估计或通过随机神经元传播梯度以实现条件计算

机器学习 2013-08-16 v1

摘要

随机神经元和硬非线性在深度学习模型中因多种原因而有用,但在许多情况下它们提出了一个挑战性难题:如何估计损失函数相对于此类随机或非平滑神经元输入的梯度?即,我们能否通过这些随机神经元进行“反向传播”?我们考察了这一问题及现有方法,并比较了适用于不同场景的四类解决方案。其中一类是针对随机二元神经元的最小方差无偏梯度估计器(REINFORCE 算法的一个特例)。第二种方法(本文引入)将二元随机神经元的操作分解为随机二元部分和平滑可微部分,后者在一阶近似下逼近纯随机二元神经元的期望效应。第三种方法涉及在原本可微的计算图中注入加性或乘性噪声。第四种方法启发式地将相对于随机输出的梯度直接复制为相对于 sigmoid 参数的梯度估计器(我们称之为 straight-through 估计器)。为了探索这些估计器有用的情境,我们考虑了小规模的{\em 条件计算},其中稀疏随机单元构成了门控器的分布式表示,这些门控器能以组合方式关闭神经网络其余部分执行的大量计算块。在这种情况下,门控单元大部分时间产生实际的 0 至关重要。由此产生的稀疏性有望被利用,以大幅降低条件计算有用的大型深度网络的计算成本。

关键词

引用

@article{arxiv.1308.3432,
  title  = {Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation},
  author = {Yoshua Bengio and Nicholas Léonard and Aaron Courville},
  journal= {arXiv preprint arXiv:1308.3432},
  year   = {2013}
}

备注

arXiv admin note: substantial text overlap with arXiv:1305.2982