中文

Lego:在文本到图像扩散模型中解耦与反演超越物体外观的个性化概念

计算机视觉与模式识别 2024-09-30 v2 计算与语言 机器学习

摘要

文本到图像(T2I)模型擅长合成名词、外观和风格等概念。为了基于某个概念的少量示例图像实现定制化内容生成,Textual Inversion 和 DreamBooth 等方法对该期望概念进行反演,并能在新场景中合成它。然而,通过自然语言反演超越物体外观与风格(形容词和动词)的个性化概念仍然是一项挑战。这些概念的两个关键特性导致了当前反演方法的局限。1)形容词和动词与名词(主体)纠缠,会妨碍基于外观的反演方法,其中主体外观泄漏到概念嵌入中;2)描述此类概念往往超出单个词嵌入。在本研究中,我们提出 Lego,一种旨在从少量示例图像中反演主体纠缠概念的文本反演方法。Lego 通过简单而有效的主体分离步骤将概念从其关联主体中解耦,并采用上下文损失来引导单/多嵌入概念的反演。在一项详尽的用户研究中,与基线相比,Lego 生成的概念在依据参考真实生成概念方面超过 70% 的时间被偏好。此外,使用 LLM 的视觉问答表明 Lego 生成的概念与概念的文本描述更一致。

关键词

引用

@article{arxiv.2311.13833,
  title  = {Lego: Learning to Disentangle and Invert Personalized Concepts Beyond Object Appearance in Text-to-Image Diffusion Models},
  author = {Saman Motamed and Danda Pani Paudel and Luc Van Gool},
  journal= {arXiv preprint arXiv:2311.13833},
  year   = {2024}
}