中文

Dropout 作为一种结构化收缩先验

机器学习 2019-05-30 v3 机器学习

摘要

深度神经网络中的 Dropout 正则化是一种神秘却有效的防止过拟合的工具。对其成功原因的解释从防止“共适应”权重到将其视为一种廉价的贝叶斯推断不等。我们提出了一种理解神经网络中乘性噪声的新框架,考虑了连续分布以及伯努利噪声(即 dropout)。我们表明乘性噪声在网络的权重上诱导出结构化收缩先验。我们通过尺度混合的重新参数化性质推导了这一等价性,且未调用任何近似。给定该等价性后,我们进一步表明 dropout 的蒙特卡洛训练目标近似于边缘 MAP 估计。我们利用这些见解提出了一种用于 ResNet 的新收缩框架,将该先验称为“自动深度确定”,因为它是网络深度上自动相关性确定的自然类比。最后,我们研究了两种在回归基准上改进上述 MAP 近似的推断策略。

关键词

引用

@article{arxiv.1810.04045,
  title  = {Dropout as a Structured Shrinkage Prior},
  author = {Eric Nalisnick and José Miguel Hernández-Lobato and Padhraic Smyth},
  journal= {arXiv preprint arXiv:1810.04045},
  year   = {2019}
}

备注

ICML 2019