Autoregressive 模型超越扩散:以 Llama 为代表的可扩展图像生成
计算机视觉与模式识别
2024-06-11 v1
摘要
我们提出 LlamaGen,一套新的图像生成模型,将大型语言模型的原始“下一个标记预测”范式应用于视觉生成领域。这是一个肯定的答案:如果按比例扩大,是否可以通过vanilla 自回归模型(如 Llama),不对视觉信号施加归纳偏见,就能实现图像生成的领先性能。我们重新审视图像标记器的设计空间,探讨图像生成模型的可扩展性以及其训练数据质量。本次探索的结果包括:(1) 一个在 ImageNet 基准上实现 16 下采样比率、0.94 rFID 重建质量和 97% 码本使用情况的图像标记器。(2) 一系列从 1.11 亿到 31 亿参数的类别条件图像生成模型,在 ImageNet 256x256 基准上实现 2.18 FID,超越了流行的扩散模型如 LDM、DiT。(3) 一个具有 7.75 亿参数的文本条件图像生成模型,基于 LAION-COCO 和高审美质量图像进行两阶段训练,展示了在视觉质量和文本对齐方面的竞争性能。(4) 我们验证了大型语言模型服务框架在优化图像生成模型推理速度方面的有效性,实现了 326%-414% 的加速。我们发布所有模型和代码以促进视觉生成和多模态基础模型的开源社区。
引用
@article{arxiv.2406.06525,
title = {Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation},
author = {Peize Sun and Yi Jiang and Shoufa Chen and Shilong Zhang and Bingyue Peng and Ping Luo and Zehuan Yuan},
journal= {arXiv preprint arXiv:2406.06525},
year = {2024}
}
备注
Codes and models: \url{https://github.com/FoundationVision/LlamaGen}