中文

当StyleGAN遇见Stable Diffusion:用于个性化图像生成的 $\mathscr{W}_+$ 适配器

计算机视觉与模式识别 2023-11-30 v1

摘要

文本到图像扩散模型在生成多样、高质量且照片级真实的图像方面表现卓越。这一进展激发了将特定身份融入生成内容的日益增长兴趣。当前多数方法采用反演方法,利用单张参考图像将目标视觉概念嵌入文本嵌入空间。然而,新合成的面部要么在表情等面部属性上高度近似参考图像,要么表现出较弱的身份保持能力。旨在引导合成面部面部属性的文本描述可能有所欠缺,因为从参考图像得出的身份信息与无关身份的面部属性之间存在复杂纠缠。为解决这些问题,我们提出新颖地使用扩展的StyleGAN嵌入空间 W+\mathcal{W}_+,以实现扩散模型增强的身份保持与解耦。通过将这一语义有意义的人脸潜空间与文本到图像扩散模型对齐,我们成功保持了高保真身份保持,并具备语义编辑能力。此外,我们提出新的训练目标以平衡提示与身份条件的影响,确保在面部属性修改期间无关身份的背景不受影响。大量实验表明,我们的方法能熟练生成不仅兼容提示描述、且在不同设置下可适用于常见StyleGAN编辑方向的个性化文本到图像输出。我们的源代码将发布于\url{https://github.com/csxmli2016/w-plus-adapter}。

关键词

引用

@article{arxiv.2311.17461,
  title  = {When StyleGAN Meets Stable Diffusion: a $\mathscr{W}_+$ Adapter for Personalized Image Generation},
  author = {Xiaoming Li and Xinyu Hou and Chen Change Loy},
  journal= {arXiv preprint arXiv:2311.17461},
  year   = {2023}
}