中文

Isolated Diffusion:使用孤立扩散引导免训练优化多概念文本到图像生成

计算机视觉与模式识别 2025-01-20 v2

摘要

大规模文本到图像扩散模型在给定目标文本提示合成高质量和多样化图像方面取得了巨大成功。尽管具有革命性的图像生成能力,当前 SOTA 模型在许多情况下仍然难以准确处理多概念生成。这种现象被称为“概念渗透”,表现为各种概念的意外重叠或合并。本文提出了一种通用的文本到图像扩散模型方法,以解决复杂场景中不同主体及其附件之间的相互干扰,追求更好的文本-图像一致性。核心思想是隔离不同概念的合成过程。我们建议将每个附件分别与对应的主体绑定,并使用拆分的文本提示。此外,我们引入了一种修正方法来解决多主体合成中的概念渗透问题。我们首先依赖预训练的物体检测和分割模型来获取主体的布局。然后我们单独隔离并重新合成每个主体及其对应的文本提示,以避免相互干扰。总体而言,我们实现了一种名为 Isolated Diffusion 的免训练策略,以优化多概念文本到图像合成。它与最新的 Stable Diffusion XL (SDXL) 和先前的 Stable Diffusion (SD) 模型兼容。我们使用各种多概念文本提示将我们的方法与其他替代方法进行了比较,并证明了其在文本-图像一致性和用户研究中的有效性及明显优势。

关键词

引用

@article{arxiv.2403.16954,
  title  = {Isolated Diffusion: Optimizing Multi-Concept Text-to-Image Generation Training-Freely with Isolated Diffusion Guidance},
  author = {Jingyuan Zhu and Huimin Ma and Jiansheng Chen and Jian Yuan},
  journal= {arXiv preprint arXiv:2403.16954},
  year   = {2025}
}

备注

Accepted by IEEE Transactions on Visualization and Computer Graphics