中文

即插即用多概念自适应混合用于高保真文本到图像合成

计算机视觉与模式识别 2025-11-25 v1 人工智能

摘要

将多个个人化概念集成到单张图像中是文本到图像(T2I)生成领域近期的重要关注方向。然而,现有方法在处理复杂多目标场景时常表现不佳,由于对个人化区域和非个人化区域的意外修改,导致效果欠佳。这不仅未能保留预期的提示结构,还破坏了区域之间的相互作用,引发语义不一致。为此,我们提出了即插即用多概念自适应混合用于高保真文本到图像合成(PnP-MIX)方法,该方法是一种创新且无需调参的方案,旨在无缝地将多个个人化概念嵌入单个生成图像中。 our 方法利用引导外观注意力,忠实地反映每个个人化概念的预期外观。为进一步提升构图保真度,我们提出了基于掩码引导的噪声混合策略,在保留背景或无关对象完整性的同时,实现对个人化对象的精确集成。最后,为缓解概念泄漏,即个人化概念特征不经意地泄漏到其他区域,我们提出了背景稀释++(background dilution++)新策略,有效减少此类泄漏,促进特征在个人化区域内的准确定位。大量实验结果表明,PnP-MIX 在单概念和多概念个人化场景中均优于现有方法,凸显其鲁健性和卓越性能,且无需额外模型调参。

关键词

引用

@article{arxiv.2511.17615,
  title  = {Plug-and-Play Multi-Concept Adaptive Blending for High-Fidelity Text-to-Image Synthesis},
  author = {Young-Beom Woo},
  journal= {arXiv preprint arXiv:2511.17615},
  year   = {2025}
}

备注

[Master's thesis, Korea University, 2025]