中文

“Oddball SGD”:用于训练深度神经网络的新颖性驱动随机梯度下降

机器学习 2015-09-21 v1

摘要

随机梯度下降 (Stochastic Gradient Descent, SGD) 可以说是当今应用于训练深度神经网络 (DNN) 的最流行的机器学习方法。最近有研究表明,SGD 可以在统计上有偏,使得训练集中的某些元素比其他元素学习得更快。在本文中,我们将 SGD 置于一个反馈回路中,其中被选中的概率与误差大小成正比。这提供了一种新颖性驱动的 oddball SGD 过程,它通过优先处理训练集中具有最大新颖性(误差)的元素,比传统 SGD 学习得更快。在我们的 DNN 示例中,oddball SGD 的训练速度比常规 SGD 快约 50 倍。

关键词

引用

@article{arxiv.1509.05765,
  title  = {"Oddball SGD": Novelty Driven Stochastic Gradient Descent for Training Deep Neural Networks},
  author = {Andrew J. R. Simpson},
  journal= {arXiv preprint arXiv:1509.05765},
  year   = {2015}
}