面向深度学习的 Kronecker 分解拟牛顿方法
机器学习
2022-02-22 v3 最优化与控制
机器学习
摘要
二阶方法能够利用比一阶方法更丰富的曲率信息来加速优化。然而,大多数方法在深度学习中并不实用,因为训练参数数量巨大。在 Goldfarb 等人(2020)中,提出了实用的拟牛顿方法,其将多层感知机(MLP)模型的 Hessian 近似为逐层分块对角矩阵,其中每层的块进一步由对应于该层受限 Hessian 结构的 Kronecker 积近似。在此,我们通过分析卷积层 Hessian 矩阵的 Kronecker 分解结构,将这些方法扩展至可应用于卷积神经网络(CNNs)。我们还提出了对 Goldfarb 等人(2020)中方法的若干改进,可同时应用于 MLP 和 CNN。这些新方法的内存需求与一阶方法相当,且每次迭代的时间复杂度远低于 Goldfarb 等人(2020)中的方法。此外,在较温和条件下证明了某变体的收敛结果。最后,我们在 MLP 自编码器和 CNN 问题上将新方法与几种当前最优(SOTA)方法进行比较,发现其优于一阶 SOTA 方法,并与二阶 SOTA 方法性能相当。
引用
@article{arxiv.2102.06737,
title = {Kronecker-factored Quasi-Newton Methods for Deep Learning},
author = {Yi Ren and Achraf Bahamou and Donald Goldfarb},
journal= {arXiv preprint arXiv:2102.06737},
year = {2022}
}