量化超参数迁移:嵌入层学习率的重要性
机器学习
2026-05-21 v1 无序系统与神经网络
人工智能
机器学习
摘要
超参数迁移允许从小规模推断最优优化超参数,这对于训练大型语言模型(LLM)至关重要。这通过拟合超参数的缩放律或通过明智的参数组合实现,如 Maximal Update(μP),使最优超参数大致保持不变。本文中,我们首先开发了一个框架,通过三个指标来量化超参数迁移:(1)缩放律拟合质量,(2)对外推误差的鲁棒性,以及(3)由于参数化选择导致的渐进损失惩罚。接下来,我们通过一系列全面的消融实验调查了为何 μP 相对于标准参数化(SP)在学习率迁移方面表现如此出色,因为现有理论不充分。我们发现,μP 相对于 SP 的绝大多数优势在于最大化嵌入层的学习率。在 SP 中,嵌入层学习率充当了瓶颈,导致训练不稳定;将其按宽度因子提高以匹配 μP 可显著平滑训练过程并提高超参数迁移。我们还发现权重衰减改善了缩放律的拟合,但在固定 token-参数设置下会损害外推的鲁棒性。
引用
@article{arxiv.2605.21486,
title = {Quantifying Hyperparameter Transfer and the Importance of Embedding Layer Learning Rate},
author = {Dayal Singh Kalra and Maissam Barkeshli},
journal= {arXiv preprint arXiv:2605.21486},
year = {2026}
}
备注
10+28 pages, 5+17 figures