参数化与优化器跨尺度幂指
机器学习
2024-07-17 v2
摘要
从小规模可靠且有效地扩展模型至大规模,通常需要精确调整许多算法和架构细节,如参数化方式和优化器选择。本文提出了一种新的参数化视角,通过考察先前工作中关于参数与数据对齐假设的关键问题,并在较弱假设和更广泛的优化器集合下推导了新的理论结果。我们的广泛实证研究包括数万个模型,这些模型使用所有参数组合:三种优化器、四种参数化方法、多种对齐假设、超过十七种学习率,以及至多268亿参数的十四种模型规模。我们发现,最佳学习率缩放方案往往会被先前工作中的假设所排除。我们的结果表明,所有参数化方法(不仅仅是最大更新参数化(muP))都可以实现超参数迁移;此外,我们提出的针对标准参数化的每层学习率方案优于muP。最后,我们表明参数化中被忽视的一个方面——Adam中的epsilon参数必须正确缩放,以避免梯度下溢,并提出Adam-atan2,这是一种新型数值稳定、尺度不变的Adam版本,完全消除了epsilon超参数。
引用
@article{arxiv.2407.05872,
title = {Scaling Exponents Across Parameterizations and Optimizers},
author = {Katie Everett and Lechao Xiao and Mitchell Wortsman and Alexander A. Alemi and Roman Novak and Peter J. Liu and Izzeddin Gur and Jascha Sohl-Dickstein and Leslie Pack Kaelbling and Jaehoon Lee and Jeffrey Pennington},
journal= {arXiv preprint arXiv:2407.05872},
year = {2024}
}
备注
63 pages, International Conference on Machine Learning 2024