中文

通过 $\mu$P 高效扩展扩散变换器

机器学习 2025-11-03 v3 人工智能 计算机视觉与模式识别

摘要

扩散变换器已成为视觉生成模型的基础,但其可扩展性受限于大规模超参数(HP)调谈的高昂成本。最近提出的最大更新参数化(μ\muP)用于标准变换器,可从小规模语言模型稳定 transferring 超参数,显著降低调谈成本。然而,是否可以将 μ\muP 应用于扩散变换器尚不明确,因为扩散变换器在架构和目标上与标准变换器不同。本文将标准 μ\muP 推广到扩散变换器上,并通过大规模实验验证其有效性。首先,我们严格证明了主流扩散变换器(包括 U-ViT、DiT、PixArt-α\alpha 和 MMDiT)的 μ\muP 与标准变换器一致,可直接应用现有 μ\muP 方法。基于此结果,我们系统性地表明 DiT-μ\muP 具备稳健的超参数 transferability。值得注意的是,使用 transfer learning rate 的 DiT-XL-2-μ\muP 实现了原始 DiT-XL-2 的 2.9 倍加速收敛。最后,我们在文本到图像生成中验证了 μ\muP 在扩大 PixArt-α\alpha 从 0.04B 到 0.61B 以及 MMDiT 从 0.18B 到 18B 中的有效性。在两种情况下,在 μ\muP 下的模型均优于基线,仅需对 PixArt-α\alpha 进行 5.5% 的一次训练运行,对 MMDiT-18B 只需 3% 的人类专家消耗。这一结果确立了 μ\muP 作为扩散变换器可扩展的原则性且高效的框架。

关键词

引用

@article{arxiv.2505.15270,
  title  = {Scaling Diffusion Transformers Efficiently via $\mu$P},
  author = {Chenyu Zheng and Xinyu Zhang and Rongzhen Wang and Wei Huang and Zhi Tian and Weilin Huang and Jun Zhu and Chongxuan Li},
  journal= {arXiv preprint arXiv:2505.15270},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025, 38 pages, 10 figures, 17 tables