中文

不要偷懒:CompleteP 实现计算高效的深度转换器

机器学习 2026-01-21 v4 人工智能

摘要

我们研究在使用不同的参数化方式(即调整模型和优化器超参数(HPs)随模型大小变化的规则)时,LLM 训练的计算效率。某些参数化方式在模型深度变化时无法将最优基础 HP(如学习率)传递,从而需要实践者在规模化时重新调参(成本高昂),或接受次优训练(当重新调参不可行时)。即使实现了 HP 传递,我们的理论表明,参数化在惰性学习范式下仍可能存在,即各层仅学习接近其线性化化的特征,阻止有效利用深度和非线性。最终,我们识别并采用称为 CompleteP 的参数化方式,实现深度一致的 HP 传递以及所有层的非惰性学习。CompleteP 使更广泛的模型宽度/深度比例能够保持计算高效,解锁适用于不同硬件环境和运营情境的更佳模型形状。此外,CompleteP 实现了相对于 prior state-of-the-art 的 12-34% 的计算效率提升。所有实验均在 Cerebras CS-3 系统上完成。一个最小实现可在 https://github.com/EleutherAI/nanoGPT-mup/tree/completep 获取。

关键词

引用

@article{arxiv.2505.01618,
  title  = {Don't be lazy: CompleteP enables compute-efficient deep transformers},
  author = {Nolan Dey and Bin Claire Zhang and Lorenzo Noci and Mufan Li and Blake Bordelon and Shane Bergsma and Cengiz Pehlevan and Boris Hanin and Joel Hestness},
  journal= {arXiv preprint arXiv:2505.01618},
  year   = {2026}
}

备注

NeurIPS 2025. v4 fixes Table 1 typo to match AdamW eps to Equation 40