FlipConcept:无需调参的文本到图像多概念个性化
计算机视觉与模式识别
2025-07-17 v2 人工智能
摘要
将多个个人化概念整合到单张图像中最近受到文本到图像(T2I)生成中的关注。然而,现有方法常因非个人化区域出现失真且需要额外微调,在复杂场景下表现下降,限制了实际应用。为此,我们提出 FlipConcept,一种无需额外调参即可将多个个人化概念无缝集成到单张图像中的新方法。我们引入引导外观注意力以提升个人化概念的视觉保真度。此外,我们引入掩码引导的噪声混合,以在概念集成过程中保护非个人化区域。最后,我们应用背景稀释以最小化概念泄漏,即个人化概念与图像中其他物体的不可寻常混合。实验表明,尽管不需调参,所提方法在单概念和多概念推理中均优于现有模型。这些结果展示了该方法在可扩展高质量多概念个性化方面的有效性与实用性。
引用
@article{arxiv.2502.15203,
title = {FlipConcept: Tuning-Free Multi-Concept Personalization for Text-to-Image Generation},
author = {Young Beom Woo and Sun Eung Kim and Seong-Whan Lee},
journal= {arXiv preprint arXiv:2502.15203},
year = {2025}
}
备注
Accepted by IEEE SMC 2025