ComFusion:基于单张图像的个性化主体多特定场景生成
计算机视觉与模式识别
2024-02-20 v1
摘要
近期个性化文本到图像(T2I)扩散模型的进展表明,能够利用有限数量的用户提供示例,基于个性化视觉概念生成图像。然而,这些模型在保持高视觉保真度方面常常遇到困难,特别是在根据文本输入操控场景时。针对这一问题,我们引入了ComFusion,一种新颖的方法,利用预训练模型生成由少量用户提供的主体图像和预定义文本场景的组合,有效融合视觉主体实例与文本特定场景,从而在各种场景中生成高保真实例。ComFusion集成了类-场景先验保持正则化,利用从预训练模型中提取的主体类别和场景特定知识来增强生成保真度。此外,ComFusion使用粗生成图像,确保它们与实例图像和场景文本有效对齐。因此,ComFusion在捕捉主体本质和保持场景保真度之间保持了微妙的平衡。与T2I个性化中的各种基线方法进行的广泛评估证明了ComFusion在定性和定量上的优越性。
引用
@article{arxiv.2402.11849,
title = {ComFusion: Personalized Subject Generation in Multiple Specific Scenes From Single Image},
author = {Yan Hong and Jianfu Zhang},
journal= {arXiv preprint arXiv:2402.11849},
year = {2024}
}