ReLU MLP 中 $\mu$P 学习率对深度的依赖性
机器学习
2023-05-16 v1 机器学习
摘要
在这篇短文中,我们考虑宽度为 、深度为 且配备平均场权值初始化的随机全连接 ReLU 网络。我们的目的是研究最大更新(P)学习率对 和 的依赖性,该学习率是使得在经过一步梯度下降后预激活均方变化在大的 下保持一致有界的最大学习率。正如 Yang 等人先前关于 P 的工作,我们发现该最大更新学习率除第一层和最后一层权值外与 无关。然而,我们发现它对 具有非平凡的依赖性,其标度行为类似于 。
引用
@article{arxiv.2305.07810,
title = {Depth Dependence of $\mu$P Learning Rates in ReLU MLPs},
author = {Samy Jelassi and Boris Hanin and Ziwei Ji and Sashank J. Reddi and Srinadh Bhojanapalli and Sanjiv Kumar},
journal= {arXiv preprint arXiv:2305.07810},
year = {2023}
}