中文

ReLU MLP 中 $\mu$P 学习率对深度的依赖性

机器学习 2023-05-16 v1 机器学习

摘要

在这篇短文中,我们考虑宽度为 nn、深度为 LL 且配备平均场权值初始化的随机全连接 ReLU 网络。我们的目的是研究最大更新(μ\muP)学习率对 nnLL 的依赖性,该学习率是使得在经过一步梯度下降后预激活均方变化在大的 n,Ln,L 下保持一致有界的最大学习率。正如 Yang 等人先前关于 μ\muP 的工作,我们发现该最大更新学习率除第一层和最后一层权值外与 nn 无关。然而,我们发现它对 LL 具有非平凡的依赖性,其标度行为类似于 L3/2L^{-3/2}

关键词

引用

@article{arxiv.2305.07810,
  title  = {Depth Dependence of $\mu$P Learning Rates in ReLU MLPs},
  author = {Samy Jelassi and Boris Hanin and Ziwei Ji and Sashank J. Reddi and Srinadh Bhojanapalli and Sanjiv Kumar},
  journal= {arXiv preprint arXiv:2305.07810},
  year   = {2023}
}