基于双层特征解耦与专家引导融合的身份保持文本到图像生成
计算机视觉与模式识别
2025-05-29 v1
摘要
大规模文本到图像生成模型的最新进展引发了主题驱动文本到图像生成的热潮,其旨在生成既符合文本描述又保持特定主体身份的定制化图像。尽管取得了显著进展,但当前方法难以从输入图像中解耦身份相关信息与身份无关细节,导致过拟合或无法保持主体身份。在本工作中,我们提出了一个新颖的框架,该框架改善了身份相关与身份无关特征的分离,并引入了一种创新的特征融合机制以提高生成图像的质量和文本对齐度。我们的框架包含两个关键组件:一个隐式-显式前景-背景解耦模块(IEDM)和一个基于混合专家(MoE)的特征融合模块(FFM)。IEDM 将用于特征级隐式解耦的可学习适配器与用于图像级显式前景-背景分离的图像修复技术相结合。FFM 动态地将身份无关特征与身份相关特征整合,即使在解耦不完全的情况下也能实现精细的特征表示。此外,我们引入了三个互补的损失函数来指导解耦过程。大量实验证明了我们提出的方法在增强图像生成质量、提高场景适应灵活性以及增加各种文本描述下生成输出的多样性方面的有效性。
引用
@article{arxiv.2505.22360,
title = {Identity-Preserving Text-to-Image Generation via Dual-Level Feature Decoupling and Expert-Guided Fusion},
author = {Kewen Chen and Xiaobin Hu and Wenqi Ren},
journal= {arXiv preprint arXiv:2505.22360},
year = {2025}
}