中文

DiffBlender:可组合且通用的多模态文本到图像扩散模型

计算机视觉与模式识别 2025-08-27 v3 人工智能 机器学习

摘要

在本研究中,我们旨在通过统一框架整合超越文本描述的多种模态,以增强基于扩散的文本到图像(T2I)生成模型的能力。为此,我们将广泛使用的条件输入分为三种模态类型:结构、布局与属性。我们提出一种多模态 T2I 扩散模型,其能够在单一架构中处理全部三种模态,而无需修改预训练扩散模型的参数,仅更新一小部分组件。我们的方法通过与现有条件生成方法的广泛定量与定性比较,在多模态生成中树立了新基准。我们证明 DiffBlender 能有效融合多源信息,并支持精细图像合成中的多样应用。代码与演示可在 https://github.com/sungnyun/diffblender 获取。

关键词

引用

@article{arxiv.2305.15194,
  title  = {DiffBlender: Composable and Versatile Multimodal Text-to-Image Diffusion Models},
  author = {Sungnyun Kim and Junsoo Lee and Kibeom Hong and Daesik Kim and Namhyuk Ahn},
  journal= {arXiv preprint arXiv:2305.15194},
  year   = {2025}
}

备注

Expert Systems with Applications 2025