宽度-深度扩展下的 μP 的谱条件
机器学习
2026-05-12 v2 机器学习
摘要
生成式基础模型正在同时在宽度和深度上进行规模化,这对稳定特征学习和可靠的超参数(HP)跨模型大小迁移提出了重大挑战。虽然最大化更新参数化(μP)为宽度扩展提供了原则性解决方案,但现有的宽度-深度联合扩展仍不完整,受架构和优化器限制,且常依赖技术复杂的理论。本文在宽度-深度联合扩展下发展了 μP 的简单统一谱框架。对于残差网络,其残差块包含 k 次变换,框架规定了权重及其每步更新的范数如何随宽度和深度扩展。它揭示了从 k=1 到 k≥2 的根本性转变,统一了此前 disparate 的 μP 表述,并确定 k≥2 情况更适用于具有多变换分支(如 Transformer)的实际架构。基于该框架,我们推导了一种通用方法,用于通过将谱约束映射到具体的 HP 参数化来实现 μP,恢复现有结果并将其扩展到额外的优化器。最后,在 GPT-2 风格语言模型上的实验表明,来自 k≥2 情况推导的 μP 实现了在宽度-深度扩展下的稳定特征学习和可靠 HP 迁移,而标准参数化和 k=1 情况下的 μP 常常无法做到这一点。这些结果支持了该提出谱框架的实际有效性。
引用
@article{arxiv.2603.00541,
title = {Spectral Condition for $\mu$P under Width-Depth Scaling},
author = {Chenyu Zheng and Rongzhen Wang and Xinyu Zhang and Chongxuan Li},
journal= {arXiv preprint arXiv:2603.00541},
year = {2026}
}
备注
76 pages, 13 figures, 40 tables