中文

基于扩散模型驱动的 GAN 逆变以实现多模态人脸图像生成

计算机视觉与模式识别 2024-05-08 v1

摘要

我们提出一种新的多模态人脸图像生成方法,将文本提示和视觉输入(如语义掩码或涂鸦图)转换为逼真的人脸图像。为此,我们采用将扩散模型(DM)中的多模态特征引入预训练 GAN 隐空间的策略,发挥两者优势。我们提出一种简单的映射和样式调制网络,用于连接两个模型,将特征图和注意力图中的有意义表示转换为隐代码。通过 GAN 逆变,估计得到的隐代码可用于生成2D或3D感知的人脸图像。我们进一步提出了多步骤训练策略,将文本和结构表示映射到生成图像中。我们提议的网络产生逼真的2D、多视角和风格化人脸图像,输入与输出良好对齐。我们使用预训练的2D和3D GAN 进行验证,我们的方法结果优于现有方法。我们的项目页面可在 https://github.com/1211sh/Diffusion-driven_GAN-Inversion/ 查看。

关键词

引用

@article{arxiv.2405.04356,
  title  = {Diffusion-driven GAN Inversion for Multi-Modal Face Image Generation},
  author = {Jihyun Kim and Changjae Oh and Hoseok Do and Soohyun Kim and Kwanghoon Sohn},
  journal= {arXiv preprint arXiv:2405.04356},
  year   = {2024}
}

备注

Accepted by CVPR 2024