中文

文本到图像扩散模型中的概念混合

计算机视觉与模式识别 2025-07-01 v1

摘要

近年来,扩散模型在文本到图像生成方面取得了显著进展,能够将抽象概念轻易转化为高保真图像。本文探讨了它们是否也能在零-shot 框架下将不同概念(从具体物体到抽象想法)混合为一个连贯的新视觉实体。具体而言,概念混合将多个概念(以文本提示表达)的关键属性合并到单个新图像中,既能捕捉每个概念的本质。我们研究了四种混合方法,每种方法都利用扩散管道的不同方面(例如,提示调度、嵌入插值或层级条件)。通过在 diverse concept 类别中进行系统实验,包括合并具体概念、合成复合词、传递艺术风格以及混合建筑地标,我们表明现代扩散模型确实展现出无需进一步训练或微调即可实现创造性混合能力。我们的大规模用户研究(包括 100 名参与者)显示,没有单一方法在所有场景中都占据优势:每种混合技术在特定条件下都表现出色,因素如提示排序、概念距离和随机种子都会影响结果。这些发现凸显了扩散模型的惊人组合潜力,同时也暴露了其对看似微小输入变更的敏感性。

关键词

引用

@article{arxiv.2506.23630,
  title  = {Blending Concepts with Text-to-Image Diffusion Models},
  author = {Lorenzo Olearo and Giorgio Longari and Alessandro Raganato and Rafael Peñaloza and Simone Melzi},
  journal= {arXiv preprint arXiv:2506.23630},
  year   = {2025}
}

备注

Currently under review