扩散变换器的比例规律
计算机视觉与模式识别
2026-03-05 v2
摘要
扩散变换器(DiT)在内容重建中(如图像和视频生成)已经取得令人满意的合成与比例特性。然而,DiT 的比例规律研究较少,通常可就给定特定计算预算所需的最佳模型规模和数据要求提供精确预测。因此,本文在从 到 FLOPs 的广泛计算预算范围内开展实验,首次确认了 DiT 存在比例规律。具体而言,DiT 的预训练损失也遵循幂律关系。基于比例规律,我们不仅可以确定最佳模型规模和所需数据,还能准确预测在 1B 参数模型和 FLOPs 计算预算下进行文本到图像生成的损失。此外,我们还展示了预训练损失的趋势与生成性能(如 FID)在各种数据集之间匹配,即使跨数据集,也如此,这补充了从计算到合成质量的映射,从而提供了一个在降低成本时评估模型性能和数据质量的可预测基准。
引用
@article{arxiv.2410.08184,
title = {Scaling Laws For Diffusion Transformers},
author = {Zhengyang Liang and Hao He and Ceyuan Yang and Bo Dai},
journal= {arXiv preprint arXiv:2410.08184},
year = {2026}
}