Lumina-Image 2.0:统一且高效的图像生成框架
计算机视觉与模式识别
2025-03-28 v1
摘要
我们介绍 Lumina-Image 2.0,一个在众多先前工作基础上取得显著进展的文本到图像生成框架。Lumina-Image 2.0 基于两个关键原则:(1)统一性——它采用统一架构(Unified Next-DiT),将文本和图像标记视为联合序列,从而实现自然的跨模态交互,并允许无缝任务扩展。此外,由于高质量的 captioner 能提供语义上良好对齐的文本-图像训练对,我们引入一种统一的 caption 系统,称为 Unified Captioner(UniCap),专为 T2I 生成任务设计。UniCap 在生成全面且准确的 caption 方面表现出色,加快收敛速度并提升提示遵循度。(2)高效性——为提高所提出模型的效率,我们开发了多阶段渐进训练策略,并引入推理加速技术,同时不损害图像质量。在学术基准和公共文本到图像领域的广泛评估表明,Lumina-Image 2.0 即使仅使用 26 亿参数,也能实现强大的性能,凸显其可扩展性和设计效率。我们已在 https://github.com/Alpha-VLLM/Lumina-Image-2.0 上发布了训练细节、代码和模型。
引用
@article{arxiv.2503.21758,
title = {Lumina-Image 2.0: A Unified and Efficient Image Generative Framework},
author = {Qi Qin and Le Zhuo and Yi Xin and Ruoyi Du and Zhen Li and Bin Fu and Yiting Lu and Jiakang Yuan and Xinyue Li and Dongyang Liu and Xiangyang Zhu and Manyuan Zhang and Will Beddow and Erwann Millon and Victor Perez and Wenhai Wang and Conghui He and Bo Zhang and Xiaohong Liu and Hongsheng Li and Yu Qiao and Chang Xu and Peng Gao},
journal= {arXiv preprint arXiv:2503.21758},
year = {2025}
}
备注
Tech Report, 21 pages, 12 figures