$\mu$P 学习率迁移的实证研究
机器学习
2025-02-17 v6
摘要
深度学习模型已成为现代 AI 研究的基石,但由于超参数搜索的高昂成本,其初始化和学习率有时会以不透明或临时的方式设定。-参数化 (P) 为这一挑战提供了可能的解决方案,它给出了模型初始化和学习率的缩放规则,据报道还能实现从小模型到大模型的零样本超参数迁移。尽管其前景广阔,但 P 方法尚未被广泛采用,这可能是由于实现复杂度较高、变体众多或理论背景复杂。这项工作从实证角度考虑 P,重点关注流行的 transformer 架构,旨在回答一个简单的问题:-Transfer 在实践中是否能产生接近最优的学习率?通过研究多达 1.2B 参数和 33B token 的十余项消融实验,以及多达 10B 参数和 190B token 的大规模实验,我们对大多数设置观察到了肯定的答案,并讨论了其他情况下的改进措施。
引用
@article{arxiv.2404.05728,
title = {An Empirical Study of $\mu$P Learning Rate Transfer},
author = {Lucas Lingle},
journal= {arXiv preprint arXiv:2404.05728},
year = {2025}
}
备注
Improved exposition, added backlog of old experiments