中文

PixArt-$\alpha$:用于逼真文本到图像合成的快速扩散 Transformer 训练

计算机视觉与模式识别 2024-01-01 v3

摘要

最先进的文本到图像(T2I)模型需要巨大的训练成本(例如数百万 GPU 小时),严重阻碍了 AIGC 社区的基础创新并增加了 CO2 排放。本文提出 PIXART-α\alpha,一种基于 Transformer 的 T2I 扩散模型,其图像生成质量可与最先进的图像生成器(例如 Imagen、SDXL 甚至 Midjourney)竞争,达到接近商业应用的标准。此外,如文献图 1 和图 2 所示,它以低训练成本支持高达 1024px 分辨率的高分辨率图像合成。为实现该目标,提出三个核心设计:(1)训练策略分解:我们设计三个不同的训练步骤,分别优化像素依赖、文本-图像对齐和图像美学质量;(2)高效 T2I Transformer:我们将交叉注意力模块引入扩散 Transformer(DiT)以注入文本条件,并精简计算密集的类条件分支;(3)高信息量数据:我们强调文本-图像对中概念密度的重要性,并利用大型视觉-语言模型自动标注稠密伪描述以辅助文本-图像对齐学习。结果,PIXART-α\alpha 的训练速度显著超越现有大规模 T2I 模型,例如 PIXART-α\alpha 仅花费 Stable Diffusion v1.5 训练时间的 10.8%(675 对比 6,250 A100 GPU 天),节省近 $300,000($26,000 对比 $320,000)并减少 90% CO2 排放。此外,与更大的 SOTA 模型 RAPHAEL 相比,我们的训练成本仅为其 1%。大量实验表明 PIXART-α\alpha 在图像质量、艺术性和语义控制方面表现出色。我们希望 PIXART-α\alpha 能为 AIGC 社区和初创企业提供新见解,加速从零构建其自有高质量且低成本的生成模型。

关键词

引用

@article{arxiv.2310.00426,
  title  = {PixArt-$\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis},
  author = {Junsong Chen and Jincheng Yu and Chongjian Ge and Lewei Yao and Enze Xie and Yue Wu and Zhongdao Wang and James Kwok and Ping Luo and Huchuan Lu and Zhenguo Li},
  journal= {arXiv preprint arXiv:2310.00426},
  year   = {2024}
}

备注

Project Page: https://pixart-alpha.github.io