MARS:面向细粒度文本到图像合成的混合自回归模型
计算机视觉与模式识别
2024-07-12 v2
摘要
自回归模型在语言生成领域取得了显著进展,但在图像合成领域仍不及扩散模型。本文提出了 MARS,一种新的文本到图像(T2I)生成框架,包含专为设计而来的语义视觉语言集成专家(SemVIE)。这一创新组件独立地处理语言和视觉信息,冻结文本组件而微调视觉组件。该方法既保留了大语言模型的 NLP 能力,又赋予其卓越的视觉理解能力。基于预训练的 Qwen-7B,MARS 具备双语生成能力,能够处理英文和中文语言提示,并具备联合图像和文本生成的能力。该框架的灵活性使其能够迁移至任何到任何任务的适应性。此外,MARS 采用多阶段训练策略,首先通过互补的双向任务建立稳健的图像-文本对齐,然后专注于细化 T2I 生成过程,显著增强了文本-图像同步性和图像细节的粒度。值得注意的是,MARS 只需相当于 SD1.5 的 9% 的 GPU 天,却在各种基准测试中取得了卓越成绩,展示了训练效率以及在各种应用中快速部署的潜力。
引用
@article{arxiv.2407.07614,
title = {MARS: Mixture of Auto-Regressive Models for Fine-grained Text-to-image Synthesis},
author = {Wanggui He and Siming Fu and Mushui Liu and Xierui Wang and Wenyi Xiao and Fangxun Shu and Yi Wang and Lei Zhang and Zhelun Yu and Haoyuan Li and Ziwei Huang and LeiLei Gan and Hao Jiang},
journal= {arXiv preprint arXiv:2407.07614},
year = {2024}
}
备注
14 pages, 9 figures