超越插入:学习身份嵌入实现语义保真的个性化扩散生成
计算机视觉与模式识别
2024-03-25 v2
摘要
基于扩散的文本到图像模型(如Stable Diffusion)在仅使用文本提示生成多样化和高质量图像方面取得了显著进展。然而,当非知名用户需要为其身份(ID)进行个性化图像生成时,T2I模型无法准确生成与其ID相关的图像。主要问题是预训练的T2I模型没有学习新ID提示与其对应视觉内容之间的映射。先前的方法要么无法准确拟合面部区域,要么失去了与T2I模型中其他现有概念的交互生成能力。换句话说,它们无法为给定提示生成与T2I对齐且语义保真的图像,这些提示包含其他概念,如场景(“埃菲尔铁塔”)、动作(“持篮球”)和面部属性(“闭眼”)。在本文中,我们专注于将准确且交互的ID嵌入插入到Stable Diffusion模型中,以实现语义保真的个性化生成。我们从两个角度应对这一挑战:面部区域拟合和语义保真令牌优化。具体来说,我们首先可视化注意力过拟合问题,并提出一种面部注意力损失来拟合面部区域,而不是纠缠与ID无关的信息,如面部布局和背景。这一关键技巧显著提高了ID准确性和与其他现有概念的交互生成能力。然后,我们将一个ID表示优化为多个分阶段令牌,每个令牌包含两个解耦特征。这种文本条件空间的扩展改善了语义保真控制。大量实验证明,与先前方法相比,我们的结果在ID准确性、基于文本的操作能力和泛化性方面表现出优越性。
引用
@article{arxiv.2402.00631,
title = {Beyond Inserting: Learning Identity Embedding for Semantic-Fidelity Personalized Diffusion Generation},
author = {Yang Li and Songlin Yang and Wei Wang and Jing Dong},
journal= {arXiv preprint arXiv:2402.00631},
year = {2024}
}
备注
14 pages, 16 figures