DiffBlender:可组合且通用的多模态文本到图像扩散模型
计算机视觉与模式识别
2025-08-27 v3 人工智能
机器学习
摘要
在本研究中,我们旨在通过统一框架整合超越文本描述的多种模态,以增强基于扩散的文本到图像(T2I)生成模型的能力。为此,我们将广泛使用的条件输入分为三种模态类型:结构、布局与属性。我们提出一种多模态 T2I 扩散模型,其能够在单一架构中处理全部三种模态,而无需修改预训练扩散模型的参数,仅更新一小部分组件。我们的方法通过与现有条件生成方法的广泛定量与定性比较,在多模态生成中树立了新基准。我们证明 DiffBlender 能有效融合多源信息,并支持精细图像合成中的多样应用。代码与演示可在 https://github.com/sungnyun/diffblender 获取。
引用
@article{arxiv.2305.15194,
title = {DiffBlender: Composable and Versatile Multimodal Text-to-Image Diffusion Models},
author = {Sungnyun Kim and Junsoo Lee and Kibeom Hong and Daesik Kim and Namhyuk Ahn},
journal= {arXiv preprint arXiv:2305.15194},
year = {2025}
}
备注
Expert Systems with Applications 2025