中文

用于训练深度神经网络的实用拟牛顿方法

机器学习 2021-01-11 v3 最优化与控制 机器学习

摘要

我们考虑开发实用的随机拟牛顿方法,特别是 Kronecker 分解块对角 BFGS 和 L-BFGS 方法,用于训练深度神经网络(DNNs)。在 DNN 训练中,变量数和梯度分量数 nn 通常达数千万量级,且 Hessian 矩阵具有 n2n^2 个元素。因此,计算并存储完整的 n×nn \times n BFGS 近似,或存储适量(步长,梯度变化)向量对以供 L-BFGS 实现使用,都是不可能的。在我们提出的方法中,我们用块对角矩阵近似 Hessian,并利用梯度和 Hessian 的结构进一步将这些块(每个对应一层)近似为两个小得多的矩阵的 Kronecker 积。这类似于 KFAC 中的方法,其在随机自然梯度方法中计算 Fisher 矩阵的 Kronecker 分解块对角近似。由于 DNN 中 Hessian 的不定和高度可变性质,我们还提出了一种新的阻尼方法,以保持 BFGS 和 L-BFGS 近似的上下界均有界。在应用于三个数据集的具有九层或十三层的自编码器前馈神经网络模型的测试中,我们的方法优于或与 KFAC 及最先进的一阶随机方法性能相当。

关键词

引用

@article{arxiv.2006.08877,
  title  = {Practical Quasi-Newton Methods for Training Deep Neural Networks},
  author = {Donald Goldfarb and Yi Ren and Achraf Bahamou},
  journal= {arXiv preprint arXiv:2006.08877},
  year   = {2021}
}