中文

SANA 1.5:线性扩散Transformer中训练时和推理时计算的高效扩展

计算机视觉与模式识别 2025-05-20 v4

摘要

本文提出了SANA-1.5,一种用于文本到图像生成中高效扩展的线性扩散Transformer。在SANA-1.0的基础上,我们引入了三项关键创新:(1) 高效训练扩展:一种深度增长范式,能够以显著减少的计算资源将参数从1.6B扩展到4.8B,并结合了内存高效的8位优化器。(2) 模型深度剪枝:一种块重要性分析技术,用于将模型高效压缩到任意大小,同时质量损失最小。(3) 推理时扩展:一种重复采样策略,用计算换取模型容量,使较小的模型在推理时能够匹配较大模型的质量。通过这些策略,SANA-1.5在GenEval上达到了0.81的文本-图像对齐分数,通过使用VILA-Judge进行推理扩展可进一步提高到0.96,在GenEval基准上建立了新的SoTA。这些创新使得在不同计算预算下实现高效模型扩展成为可能,同时保持高质量,使高质量图像生成更加普及。我们发布了代码和预训练模型。

关键词

引用

@article{arxiv.2501.18427,
  title  = {SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer},
  author = {Enze Xie and Junsong Chen and Yuyang Zhao and Jincheng Yu and Ligeng Zhu and Chengyue Wu and Yujun Lin and Zhekai Zhang and Muyang Li and Junyu Chen and Han Cai and Bingchen Liu and Daquan Zhou and Song Han},
  journal= {arXiv preprint arXiv:2501.18427},
  year   = {2025}
}