中文

用于深度神经网络正则化的并行 Dither 与 Dropout

机器学习 2015-08-31 v1 神经与进化计算

摘要

在训练深度神经网络时,有效的正则化可能决定其成败。最近,dither 被建议作为批平均随机梯度下降(SGD)训练期间 dropout 的替代正则化方法。在本文中,我们表明这些方法在没有批平均的情况下会失效,并且我们引入了一种新的并行正则化方法,该方法可以在没有批平均的情况下使用。我们在并行正则化的非批 SGD 上取得的结果明显优于使用批 SGD 所能达到的效果。此外,我们的结果表明 dither 和 dropout 是互补的。

关键词

引用

@article{arxiv.1508.07130,
  title  = {Parallel Dither and Dropout for Regularising Deep Neural Networks},
  author = {Andrew J. R. Simpson},
  journal= {arXiv preprint arXiv:1508.07130},
  year   = {2015}
}