中文

MagicFace:无需训练的通用风格人像图像定制合成

计算机视觉与模式识别 2024-11-19 v5 人工智能

摘要

当前的人像图像定制方法利用Stable Diffusion(SD)的丰富语义先验。然而,由于SD并非专门为人像生成设计,这些方法通常需要在大规模数据集上进行大量微调,这使它们容易过拟合,并阻碍其为先前未见风格个体进行个性化的能力。此外,这些方法广泛聚焦于单概念人像图像合成,缺乏使用多个给定概念定制个体的灵活性,从而限制了其更广泛的应用。本文提出了MagicFace,一种用于多概念通用风格人像图像个性化合成的无需训练的新方法。我们的核心思想是模拟人类在给定特定概念时如何创建图像,即首先建立考虑概念的形状和姿态等因素的语义布局,然后通过与概念在像素级别进行比较来优化细节。为实现这一过程,我们引入了一个由粗到细的生成流水线,涉及两个连续阶段:语义布局构建和概念特征注入。这通过我们的参考感知自注意力(RSA)和区域分组混合注意力(RBA)机制来实现。在第一阶段,RSA使潜变量图像能够同时查询所有参考概念的特征,提取整体语义理解以促进初始语义布局的建立。在第二阶段,我们采用基于注意力的语义分割方法来逐步骤定位所有概念的潜变量生成区域。随后,RBA将潜变量图像的像素划分为语义组,每个组从对应的参考概念查询细粒度特征。大量实验证明了我们MagicFace的优越性。

关键词

引用

@article{arxiv.2408.07433,
  title  = {MagicFace: Training-free Universal-Style Human Image Customized Synthesis},
  author = {Yibin Wang and Weizhong Zhang and Cheng Jin},
  journal= {arXiv preprint arXiv:2408.07433},
  year   = {2024}
}

备注

project page: https://codegoat24.github.io/MagicFace