中文

SUR-adapter:利用大语言模型增强文本到图像预训练扩散模型

计算与语言 2023-11-30 v4 计算机视觉与模式识别

摘要

扩散模型已成为流行的文本到图像生成模型,可在文本提示引导下生成高质量且内容丰富的图像。然而,当输入提示为简洁叙述时,现有模型在语义理解和常识推理方面存在局限,导致图像生成质量低下。为提升对叙述式提示的能力,我们提出一种简单而有效的参数高效微调方法,称为语义理解与推理适配器(SUR-adapter),用于预训练扩散模型。为此,我们首先收集并标注了一个新数据集 SURD,包含超过 57,000 个语义校正的多模态样本。每个样本包含一条简洁叙述提示、一条基于复杂关键词的提示和一张高质量图像。随后,我们将叙述提示的语义表示对齐到复杂提示,并通过知识蒸馏将大语言模型(LLMs)的知识迁移到我们的 SUR-adapter,使其获得强大的语义理解与推理能力,为文本到图像生成构建高质量的文本语义表示。我们通过集成多个 LLM 与流行的预训练扩散模型进行实验,展示了我们的方法在使扩散模型理解并推理简洁自然语言且不降低图像质量方面的有效性。我们的方法能使文本到图像扩散模型更易用、用户体验更好,这表明我们的方法有望通过弥合简洁叙述提示与复杂关键词提示之间的语义鸿沟,进一步推进用户友好型文本到图像生成模型的发展。代码发布于 https://github.com/Qrange-group/SUR-adapter。

关键词

引用

@article{arxiv.2305.05189,
  title  = {SUR-adapter: Enhancing Text-to-Image Pre-trained Diffusion Models with Large Language Models},
  author = {Shanshan Zhong and Zhongzhan Huang and Wushao Wen and Jinghui Qin and Liang Lin},
  journal= {arXiv preprint arXiv:2305.05189},
  year   = {2023}
}

备注

accepted by ACM MM 2023