中文

PixArt-\Sigma: 面向 4K 文本到图像生成的 Diffusion Transformer 弱到强训练

计算机视觉与模式识别 2024-03-19 v2

摘要

本文介绍 PixArt-\Sigma,一种能够直接生成 4K 分辨率图像的 Diffusion Transformer 模型 (DiT)。PixArt-\Sigma 相较于其前身 PixArt-\alpha 有显著进步,提供了保真度明显更高的图像,并改善了与文本提示的对齐。PixArt-\Sigma 的一个关键特点是其训练效率。利用 PixArt-\alpha 的基础预训练,它通过引入更高质量的数据从“较弱”的基线进化为“更强”的模型,我们将此过程称为“弱到强训练”。PixArt-\Sigma 的进步有两个方面:(1) 高质量训练数据:PixArt-\Sigma 融入了优质图像数据,并配以更精确、更详细的图像描述。(2) 高效 Token 压缩:我们在 DiT 框架内提出了一种新颖的注意力模块,可同时压缩键和值,显著提高效率并促进超高分辨率图像生成。得益于这些改进,PixArt-\Sigma 以远小于现有文本到图像扩散模型的模型规模(0.6B 参数)实现了卓越的图像质量和用户提示遵循能力,例如 SDXL(2.6B 参数)和 SD Cascade(5.1B 参数)。此外,PixArt-\Sigma 生成 4K 图像的能力支持创建高分辨率海报和壁纸,有效助力电影和游戏等行业制作高质量视觉内容。

关键词

引用

@article{arxiv.2403.04692,
  title  = {PixArt-\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation},
  author = {Junsong Chen and Chongjian Ge and Enze Xie and Yue Wu and Lewei Yao and Xiaozhe Ren and Zhongdao Wang and Ping Luo and Huchuan Lu and Zhenguo Li},
  journal= {arXiv preprint arXiv:2403.04692},
  year   = {2024}
}

备注

Project Page: https://pixart-alpha.github.io/PixArt-sigma-project/