中文

Dropout 是随机 delta 规则的特殊情形:更快且更准确的深度学习

机器学习 2019-02-11 v2 计算机视觉与模式识别 机器学习

摘要

多层神经网络在文本、语音和图像处理的许多基准任务上取得了卓越性能。已知层次模型中的非线性参数估计容易出现过拟合与设定错误。应对这些估计及相关问题(局部极小、共线性、特征发现等)的一种方法是 Dropout (Hinton 等 2012, Baldi 等 2016)。Dropout 算法在每次更新前以概率 pp 按伯努利随机变量移除隐藏单元,对网络产生随机“冲击”并在更新间取平均。本文中我们将表明,Dropout 是 1990 年最初发表的更一般模型——随机 Delta 规则(Stochastic Delta Rule, SDR)(Hanson, 1990)的特殊情形。SDR 将网络中每个权重重新定义为具有均值 μwij\mu_{w_{ij}} 和标准差 σwij\sigma_{w_{ij}} 的随机变量。每个权重随机变量在每次前向激活时被采样,从而创造出共享权重的指数级数量的潜在网络。两个参数均依据预测误差更新,由此产生反映预测误差局部历史与局部模型平均的权重噪声注入。因此,SDR 对每个权重实现更敏感的依赖于局部梯度的模拟退火,在极限下收敛到贝叶斯最优网络。使用修改版 DenseNet 在标准基准(CIFAR)上的测试表明,SDR 在测试误差上优于标准 Dropout:在 CIFAR-100 上以 DenseNet-BC 250 约优 17%17\%,在更小网络中约优 1214%12-14\%。我们还表明,SDR 在仅 35 个 epoch 内达到 Dropout 在 100 个 epoch 内获得的相同精度。

关键词

引用

@article{arxiv.1808.03578,
  title  = {Dropout is a special case of the stochastic delta rule: faster and more accurate deep learning},
  author = {Noah Frazier-Logue and Stephen José Hanson},
  journal= {arXiv preprint arXiv:1808.03578},
  year   = {2019}
}

备注

6 pages, 7 figures; submitted to ICML