LogoSticker:将 Logo 插入扩散模型用于定制化生成
计算机视觉与模式识别
2024-07-19 v1
摘要
近期的文本到图像模型定制化进展凸显了将新概念与少量示例集成的重要性。然而,这些进展主要局限于广为人知的主体,这类主体可通过模型的充分共享先验知识来学习。相比之下,标志符号因其独特的图案和文本元素,难以在扩散模型中建立共享知识,因而具有独特的挑战。为弥合这一差距,我们提出了 Logo 插入任务。我们的目标是将 Logo 身份插入扩散模型,使其在 varied contexts 中无缝合成。我们提出了一种新颖的两阶段管道 LogoSticker 来解决此任务。首先,我们提出了演员-评论家关系预训练算法,解决了模型理解 Logo 可能空间位置与其他物体相互作用的非平凡差距。其次,我们提出了解耦的身份学习算法,使 Logo 的精确定位和身份提取成为可能。LogoSticker 能在 diverse contexts 中准确且和谐地生成 Logo。我们全面验证了 LogoSticker 在定制化方法和大型模型(如 DALLE~3)中的有效性。
引用
@article{arxiv.2407.13752,
title = {LogoSticker: Inserting Logos into Diffusion Models for Customized Generation},
author = {Mingkang Zhu and Xi Chen and Zhongdao Wang and Hengshuang Zhao and Jiaya Jia},
journal= {arXiv preprint arXiv:2407.13752},
year = {2024}
}
备注
ECCV2024