中文

归一化 Transformer 中的学习率迁移

机器学习 2026-05-04 v2 人工智能 机器学习

摘要

归一化 Transformer 或 nGPT (arXiv:2410.01131) 取得了显著的训练加速,无需权重衰减或学习率热身。然而,尽管其超参数显式地随模型大小而比例缩放,我们观察到 nGPT 在模型维度和 token 时域之间不 exhibits 学习率迁移。为纠正这一问题,我们结合数值实验和对齐指数 (arXiv:2407.05872) 的原则性方法,重新审视并修改了 μ\muP 方法中超参数迁移的方法 (arXiv:2011.14522)。结果是我们提出一种新的 nGPT 参数化方法,称为 ν\nuGPT。通过广泛的经验验证,我们发现 ν\nuGPT 在宽度、深度和 token 时域上都 exhibits 学习率迁移。

关键词

引用

@article{arxiv.2604.27077,
  title  = {Learning Rate Transfer in Normalized Transformers},
  author = {Boris Shigida and Boris Hanin and Andrey Gromov},
  journal= {arXiv preprint arXiv:2604.27077},
  year   = {2026}
}