中文

基于信息增强扩散模型的段落到图像生成

计算机视觉与模式识别 2025-05-07 v3

摘要

文本到图像(T2I)模型近来发展迅速,在保真度与文本对齐能力方面取得了令人惊叹的性能。然而,给定一段长段落(多达512词)时,这些生成模型仍难以实现强对齐,且无法生成描绘复杂场景的图像。本文针对段落到图像生成任务,提出了一种信息增强的扩散模型,称为ParaDiffusion,其深入探究将大语言模型广泛语义理解能力迁移至图像生成任务中。其核心是使用大语言模型(如Llama V2)对长文本进行编码,随后通过LORA微调以在生成任务中对齐文本-图像特征空间。为促进长文本语义对齐的训练,我们还构建了一个高质量的段落-图像配对数据集,即ParaImage。该数据集包含少量高质量、精细标注的数据,以及一个使用视觉-语言模型生成长文本描述的大规模合成数据集。实验表明,在ViLG-300和ParaPrompts上,ParaDiffusion优于最先进模型(SD XL、DeepFloyd IF),在视觉吸引力和文本忠实度方面分别实现了高达15%和45%的人工投票率提升。代码与数据集将公开发布,以促进社区在长文本对齐方面的研究。

关键词

引用

@article{arxiv.2311.14284,
  title  = {Paragraph-to-Image Generation with Information-Enriched Diffusion Model},
  author = {Weijia Wu and Zhuang Li and Yefei He and Mike Zheng Shou and Chunhua Shen and Lele Cheng and Yan Li and Tingting Gao and Di Zhang},
  journal= {arXiv preprint arXiv:2311.14284},
  year   = {2025}
}

备注

The project website is at: https://weijiawu.github.io/ParaDiffusionPage/. Code: https://github.com/weijiawu/ParaDiffusion