中文

UNIMO-G:基于多模态条件扩散的统一图像生成

计算机视觉与模式识别 2024-06-07 v3

摘要

现有的文本到图像扩散模型主要根据文本提示生成图像。然而,文本描述固有的简洁性在忠实合成具有复杂细节(如特定实体或场景)的图像时带来了挑战。本文提出了 UNIMO-G,这是一个简单的多模态条件扩散框架,可处理具有交错文本和视觉输入的多模态提示,展示了文本驱动和主体驱动图像生成的统一能力。UNIMO-G 包含两个核心组件:一个用于编码多模态提示的多模态大语言模型(MLLM),以及一个基于编码的多模态输入生成图像的条件去噪扩散网络。我们利用两阶段训练策略来有效训练该框架:首先在大规模文本-图像对上进行预训练以发展条件图像生成能力,然后使用多模态提示进行指令微调以实现统一的图像生成能力。我们采用了一个精心设计的数据处理流水线,涉及语言基础和图像分割,以构建多模态提示。UNIMO-G 在文本到图像生成和零样本主体驱动合成方面均表现出色,并且在从涉及多个图像实体的复杂多模态提示生成高保真图像方面尤为有效。

关键词

引用

@article{arxiv.2401.13388,
  title  = {UNIMO-G: Unified Image Generation through Multimodal Conditional Diffusion},
  author = {Wei Li and Xue Xu and Jiachen Liu and Xinyan Xiao},
  journal= {arXiv preprint arXiv:2401.13388},
  year   = {2024}
}

备注

Accepted by ACL 2024, Main Conference, Long Paper