关于随机广义Gauss-Newton方法训练DNN的潜力
机器学习
2020-06-11 v4 机器学习
摘要
继早期关于深度学习的无Hessian方法的工作之后,我们研究了一种用于训练DNN的随机广义Gauss-Newton方法(SGN)。SGN是一种具有高效迭代的二阶优化方法,我们证明其通常比标准SGD需要少得多的迭代次数即可收敛。顾名思义,SGN使用Gauss-Newton近似作为Hessian矩阵,并且为了计算近似搜索方向,依赖于结合前向和反向自动微分的共轭梯度法。尽管SGD及其一阶变体取得了成功,并且尽管基于Gauss-Newton Hessian近似的无Hessian方法已被理论上提出作为训练DNN的实用方法,我们相信SGN在大数据小批量场景中具有大量未被发现且尚未充分展现的潜力。针对该设置,我们证明SGN不仅在迭代次数上大幅优于SGD,而且在运行时间上也如此。这得益于我们在Theano深度学习平台上提出的SGN的高效、易用且灵活的实现,与Tensorflow和Pytorch不同,它支持前向自动微分。这使得研究人员能够进一步研究和改进这种有前景的优化技术,并希望重新将随机二阶方法视为训练DNN的竞争性优化技术;我们也希望SGN的潜力能促使前向自动微分被添加到Tensorflow或Pytorch中。我们的结果还表明,在大数据小批量场景中,SGN相对于其超参数比SGD更鲁棒(我们的基准测试中从未需要调整其步长!),这减轻了昂贵且对一阶方法性能至关重要的超参数调优过程。
引用
@article{arxiv.2006.02409,
title = {On the Promise of the Stochastic Generalized Gauss-Newton Method for Training DNNs},
author = {Matilde Gargiani and Andrea Zanelli and Moritz Diehl and Frank Hutter},
journal= {arXiv preprint arXiv:2006.02409},
year = {2020}
}