中文

多概念文本到图像生成的语义保护扩散模型 SPDiffusion

计算机视觉与模式识别 2025-03-04 v2

摘要

近期的文本到图像模型在生成高质量图像方面取得了显著成果。然而,在处理多概念生成以创建包含多个角色或物体的图像时,现有方法常常 suffer from semantic entanglement,包括 concept entanglement 和不当属性绑定,导致显著的文本-图像不一致。我们识别到,语义 entanglement 产生于 latent features 的某些区域注意力错误地关注 concept 和 attribute tokens。本文提出一种 Semantic Protection Diffusion Model (SPDiffusion) 以解决 concept entanglement 和不当属性绑定,仅使用文本提示即可实现。SPDiffusion 框架引入了 novel concept region extraction 方法 SP-Extraction 以解决 cross-attention 中的 region entanglement,同时引入 SP-Attn 用于保护 concept 区域免受无关属性和概念的影响。为评估我们的方法, 我们在既有基准测试中进行测试, SPDiffusion 实现了 state-of-the-art 结果,充分展示了其有效性。

关键词

引用

@article{arxiv.2409.01327,
  title  = {SPDiffusion: Semantic Protection Diffusion Models for Multi-concept Text-to-image Generation},
  author = {Yang Zhang and Rui Zhang and Xuecheng Nie and Haochen Li and Jikun Chen and Yifan Hao and Xin Zhang and Luoqi Liu and Ling Li},
  journal= {arXiv preprint arXiv:2409.01327},
  year   = {2025}
}