面向深度学习随机一阶方法的层自适应步长
机器学习
2023-07-07 v3 最优化与控制
摘要
我们提出一种用于深度学习中最小化经验损失函数的随机一阶优化方法的逐层自适应步长流程,免去用户调节学习率(LR)之需。所提方法利用深度神经网络(DNN)中 Hessian 矩阵对角块所含的逐层随机曲率信息,为每一层计算自适应步长(即 LR)。该方法的内存需求与一阶方法相当,而每次迭代的时间复杂度仅增加约相当于一次额外梯度计算的开销。数值实验表明,结合所提逐层步长的带动量 SGD 与 AdamW 能够选择有效的 LR 调度,并在 Autoencoder、卷积神经网络(CNN)与图卷积网络(GCN)模型上训练 DNN 时优于这些方法的精调 LR 版本以及流行的一阶与二阶算法。最后,我们证明了使用逐层步长的理想化 SGD 在采用全批量梯度时可线性收敛。
引用
@article{arxiv.2305.13664,
title = {Layer-wise Adaptive Step-Sizes for Stochastic First-Order Methods for Deep Learning},
author = {Achraf Bahamou and Donald Goldfarb},
journal= {arXiv preprint arXiv:2305.13664},
year = {2023}
}
备注
requires revision