使用随机投影的可扩展自适应随机优化
机器学习
2016-11-22 v1 机器学习
摘要
诸如 AdaGrad 等自适应随机梯度方法在训练深度神经网络中尤其受到欢迎。最常用且研究最多的变体通过累积过去的梯度来保持对二阶信息的对角矩阵近似,从而用于自适应地调整步长。在某些情况下,全矩阵变体的 AdaGrad 预期能获得更好的性能,但在高维情况下其在计算上是不可行的。我们提出了 Ada-LR 和 RadaGrad,这是两种基于随机降维的全矩阵 AdaGrad 的计算高效近似。它们能够捕捉特征之间的依赖关系,并取得与全矩阵 AdaGrad 相似的性能,但计算成本要小得多。我们证明,Ada-LR 的遗憾界接近于全矩阵 AdaGrad 的遗憾界,后者对维度的依赖可能比对角变体小指数级。在经验上,我们表明 Ada-LR 和 RadaGrad 的表现与全矩阵 AdaGrad 相似。在训练卷积神经网络以及循环神经网络的任务中,RadaGrad 比 AdaGrad 对角变体实现了更快的收敛。
引用
@article{arxiv.1611.06652,
title = {Scalable Adaptive Stochastic Optimization Using Random Projections},
author = {Gabriel Krummenacher and Brian McWilliams and Yannic Kilcher and Joachim M. Buhmann and Nicolai Meinshausen},
journal= {arXiv preprint arXiv:1611.06652},
year = {2016}
}
备注
To appear in Advances in Neural Information Processing Systems 29 (NIPS 2016)