中文

通过名人基将任意人物插入扩散模型

计算机视觉与模式识别 2023-06-02 v1

摘要

将预训练的大型文本到图像模型(如 Stable Diffusion)定制以生成新概念(例如用户自身)存在精细需求。然而,即便训练时给定若干图像,以往定制方法新添加的概念往往表现出弱于原始概念的组合能力。因此我们提出一种新的个性化方法,仅需 一张人脸照片\textbf{一张人脸照片} 且在 3 分钟\textbf{3 分钟} 内仅用 1024 个可学习参数\textbf{1024 个可学习参数},即可将独特个体无缝集成到预训练扩散模型中。由此,我们可轻松从该人物的文本提示生成惊艳图像,呈现任意姿态或位置,与任何人交互并做任何可想象之事。为此,我们首先从预训练大型文本编码器的嵌入空间中分析并构建定义良好的名人基(celeb basis)。随后,给定一张人脸照片作为目标身份,我们通过优化该基的权重并锁定其他所有参数来生成其自身嵌入。得益于所提名人基,我们定制模型中的新身份展现出优于以往个性化方法的概念组合能力。此外,我们的模型还可一次性学习多个新身份并使其交互,而以往定制模型无法实现。代码将公开。

关键词

引用

@article{arxiv.2306.00926,
  title  = {Inserting Anybody in Diffusion Models via Celeb Basis},
  author = {Ge Yuan and Xiaodong Cun and Yong Zhang and Maomao Li and Chenyang Qi and Xintao Wang and Ying Shan and Huicheng Zheng},
  journal= {arXiv preprint arXiv:2306.00926},
  year   = {2023}
}

备注

Project page: http://celeb-basis.github.io ; Github repository: https://github.com/ygtxr1997/CelebBasis