中文

DiT-Air: 重新审视文本到图像生成中扩散模型架构设计的效率

计算机视觉与模式识别 2025-03-18 v2

摘要

本文聚焦于文本到图像生成中的扩散转换器 (DiT),系统性地研究了架构选择、文本条件化策略以及训练协议。我们评估了多种基于DiT的架构——包括PixArt风格和MMDiT变体——并与一个标准DiT变体进行比较,该变体直接处理拼接后的文本和噪声输入。意外地,我们的发现表明,标准DiT的性能与专用模型相当,同时在参数效率方面尤为突出,特别是在大规模扩展时。通过采用层级参数共享策略,我们将模型规模较MMDiT架构减少66%,而性能影响微乎其微。基于对关键组件(如文本编码器和变分自编码器VAEs)的深入分析,我们引入了DiT-Air和DiT-Air-Lite。通过监督微调和奖励微调,DiT-Air在GenEval和T2I CompBench上实现了最先进的性能,而DiT-Air-Lite虽规模紧凑,却在大多数现有模型中均表现出色。

关键词

引用

@article{arxiv.2503.10618,
  title  = {DiT-Air: Revisiting the Efficiency of Diffusion Model Architecture Design in Text to Image Generation},
  author = {Chen Chen and Rui Qian and Wenze Hu and Tsu-Jui Fu and Jialing Tong and Xinze Wang and Lezhi Li and Bowen Zhang and Alex Schwing and Wei Liu and Yinfei Yang},
  journal= {arXiv preprint arXiv:2503.10618},
  year   = {2025}
}