中文

DisenBooth:面向主体驱动文本到图像生成的保身份解耦微调

计算机视觉与模式识别 2024-02-28 v4

摘要

主体驱动文本到图像生成旨在基于文本描述生成给定主体的定制化图像,已引起越来越多的关注。现有方法主要借助于微调预训练生成模型,其中与身份相关的信息(如男孩)和与身份无关的信息(如背景或男孩的姿态)在潜在嵌入空间中相互纠缠。然而,高度纠缠的潜在嵌入可能导致主体驱动文本到图像生成的失败,表现为:(i)隐藏于纠缠嵌入中的身份无关信息可能主导生成过程,导致生成图像严重依赖于无关信息而忽略给定文本描述;(ii)纠缠嵌入所携带的与身份相关的信息无法被恰当保留,导致生成图像中主体身份发生改变。为解决这些问题,我们提出 DisenBooth,一种面向主体驱动文本到图像生成的保身份解耦微调框架。具体而言,DisenBooth 在去噪过程中微调预训练扩散模型。与以往利用纠缠嵌入对每幅图像去噪的工作不同,DisenBooth 改用解耦嵌入分别保留主体身份并捕获身份无关信息。我们进一步设计了新颖的弱去噪与对比嵌入辅助微调目标以实现解耦。大量实验表明,我们所提出的 DisenBooth 框架在保身份嵌入下优于主体驱动文本到图像生成的基线模型。此外,通过结合保身份嵌入与身份无关嵌入,DisenBooth 展现出更强的生成灵活性与可控性。

关键词

引用

@article{arxiv.2305.03374,
  title  = {DisenBooth: Identity-Preserving Disentangled Tuning for Subject-Driven Text-to-Image Generation},
  author = {Hong Chen and Yipeng Zhang and Simin Wu and Xin Wang and Xuguang Duan and Yuwei Zhou and Wenwu Zhu},
  journal= {arXiv preprint arXiv:2305.03374},
  year   = {2024}
}