中文

Lumina-mGPT 2.0:独立自回归图像建模

计算机视觉与模式识别 2025-07-25 v1

摘要

我们提出 Lumina-mGPT 2.0,这是一个独立的、仅包含解码器的自回归模型,它重新审视并重新活化了用于高质量图像生成及更多任务的自回归范式。不同于依赖预训练组件或混合架构的现有方法,Lumina-mGPT 2.0 从头开始进行训练,实现了自由受限的架构设计和许可证自由度。在保持自回归建模固有灵活性和可组合性的同时,Lumina-mGPT 2.0 在生成质量上与 DALL-E 3 和 SANA 等领先扩散模型持平。我们的统一分词方案使模型能够在单一生成框架内无缝处理多种任务,包括主题驱动生成、图像编辑、可控合成和密集预测。为进一步提升可用性,我们引入了推理时扩展和推测雅可比采样等高效解码策略,以分别提升质量和速度。在标准文本到图像基准(如 GenEval、DPG)上的广泛评估表明,Lumina-mGPT 2.0 不仅匹配甚至在某些情况下超越了基于扩散的模型。此外,我们在 Graph200K基准测试上确认了其多任务能力,原生Lumina-mGPT 2.0表现卓越。这些结果将Lumina-mGPT 2.0定位为统一多模态生成的强大且灵活的基础模型。我们已在 https://github.com/Alpha-VLLM/Lumina-mGPT-2.0 上发布了训练细节、代码和模型。

关键词

引用

@article{arxiv.2507.17801,
  title  = {Lumina-mGPT 2.0: Stand-Alone AutoRegressive Image Modeling},
  author = {Yi Xin and Juncheng Yan and Qi Qin and Zhen Li and Dongyang Liu and Shicheng Li and Victor Shea-Jay Huang and Yupeng Zhou and Renrui Zhang and Le Zhuo and Tiancheng Han and Xiaoqing Sun and Siqi Luo and Mengmeng Wang and Bin Fu and Yuewen Cao and Hongsheng Li and Guangtao Zhai and Xiaohong Liu and Yu Qiao and Peng Gao},
  journal= {arXiv preprint arXiv:2507.17801},
  year   = {2025}
}

备注

Tech Report, 23 pages, 11 figures, 7 tables