归一化 Transformer 中的学习率迁移
机器学习
2026-05-04 v2 人工智能
机器学习
摘要
归一化 Transformer 或 nGPT (arXiv:2410.01131) 取得了显著的训练加速,无需权重衰减或学习率热身。然而,尽管其超参数显式地随模型大小而比例缩放,我们观察到 nGPT 在模型维度和 token 时域之间不 exhibits 学习率迁移。为纠正这一问题,我们结合数值实验和对齐指数 (arXiv:2407.05872) 的原则性方法,重新审视并修改了 P 方法中超参数迁移的方法 (arXiv:2011.14522)。结果是我们提出一种新的 nGPT 参数化方法,称为 GPT。通过广泛的经验验证,我们发现 GPT 在宽度、深度和 token 时域上都 exhibits 学习率迁移。
关键词
引用
@article{arxiv.2604.27077,
title = {Learning Rate Transfer in Normalized Transformers},
author = {Boris Shigida and Boris Hanin and Andrey Gromov},
journal= {arXiv preprint arXiv:2604.27077},
year = {2026}
}