中文

$\mu$P 学习率迁移的实证研究

机器学习 2025-02-17 v6

摘要

深度学习模型已成为现代 AI 研究的基石,但由于超参数搜索的高昂成本,其初始化和学习率有时会以不透明或临时的方式设定。μ\mu-参数化 (μ\muP) 为这一挑战提供了可能的解决方案,它给出了模型初始化和学习率的缩放规则,据报道还能实现从小模型到大模型的零样本超参数迁移。尽管其前景广阔,但 μ\muP 方法尚未被广泛采用,这可能是由于实现复杂度较高、变体众多或理论背景复杂。这项工作从实证角度考虑 μ\muP,重点关注流行的 transformer 架构,旨在回答一个简单的问题:μ\mu-Transfer 在实践中是否能产生接近最优的学习率?通过研究多达 1.2B 参数和 33B token 的十余项消融实验,以及多达 10B 参数和 190B token 的大规模实验,我们对大多数设置观察到了肯定的答案,并讨论了其他情况下的改进措施。

关键词

引用

@article{arxiv.2404.05728,
  title  = {An Empirical Study of $\mu$P Learning Rate Transfer},
  author = {Lucas Lingle},
  journal= {arXiv preprint arXiv:2404.05728},
  year   = {2025}
}

备注

Improved exposition, added backlog of old experiments