通过二阶视角审视 Adam 以研究 K-FAC 启发式方法
机器学习
2024-06-17 v3 机器学习
摘要
深度学习优化研究的特点在于一阶基于梯度的方法(如 SGD 和 Adam)的计算效率与二阶基于曲率的方法(如拟牛顿法和 K-FAC)的理论效率之间的张力。注意到二阶方法通常仅在加入稳定启发式(如 Levenberg-Marquardt 阻尼)时才有效运作,我们探究这些启发式(相对于二阶曲率模型)对二阶算法性能的贡献有多大。因此我们研究 AdamQLR:一种受二阶视角下考量 Adam 启发,将来自 K-FAC(Martens & Grosse, 2015)的阻尼与学习率选择技术与 Adam 提出的更新方向相结合的优化器。我们在不同规模与超参数调优方法的系列回归与分类任务上评估 AdamQLR,得出结论:K-FAC 的自适应启发式作为独立组件其通用有效性参差不齐,并发现未调优的 AdamQLR 设置在性能与运行时间上可达到与调优基准相当的水平。
引用
@article{arxiv.2310.14963,
title = {Studying K-FAC Heuristics by Viewing Adam through a Second-Order Lens},
author = {Ross M. Clarke and José Miguel Hernández-Lobato},
journal= {arXiv preprint arXiv:2310.14963},
year = {2024}
}
备注
33 pages, 21 figures, 7 tables. Published at ICML 2024