面向文本到图像模型多主体个性化的身份解耦
计算机视觉与模式识别
2024-10-29 v3 人工智能
摘要
文本到图像扩散模型在基于少量参考图像生成个性化主体方面取得了显著成功。然而,当前方法在同时生成多个主体时常常失败,导致身份混合,即不同主体的属性被组合在一起。在这项工作中,我们提出了MuDI,一个新颖的框架,通过有效解耦多个主体的身份来实现多主体个性化。我们的主要思想是利用基础分割模型(Segment Anything)生成的分割主体,在训练和推理中分别作为数据增强和生成过程初始化的形式。此外,我们引入了一个新的指标,以更好地评估我们的方法在多主体个性化上的性能。实验结果表明,我们的MuDI能够生成高质量的个性化图像,且不会出现身份混合,即使对于高度相似的主体也是如此,如图1所示。具体来说,在人工评估中,MuDI在多个主体个性化且无身份混合方面的成功率是现有基线的两倍,并且相对于最强基线,有超过70%的偏好率。
引用
@article{arxiv.2404.04243,
title = {Identity Decoupling for Multi-Subject Personalization of Text-to-Image Models},
author = {Sangwon Jang and Jaehyeong Jo and Kimin Lee and Sung Ju Hwang},
journal= {arXiv preprint arXiv:2404.04243},
year = {2024}
}
备注
NeurIPS 2024. Project page: https://mudi-t2i.github.io/