中文

基于多模态辅助的MM2Latent:GAN中的文本到面部图像生成与编辑

计算机视觉与模式识别 2024-09-18 v1

摘要

生成人类肖像是图像生成领域的热门话题,例如mask-to-face生成和text-to-face生成。然而,这些单一模态生成方法在图像生成可控性方面存在不足。可以通过探索各种模态的优势与互补性来增强可控性。例如,我们可以利用文本控制多样化属性的优势,利用mask控制空间位置的优势。当前基于多模态生成的SOTA方法受限于其对大量超参数、推理阶段的手动操作、训练和推理时的高计算需求,或无法编辑真实图像。本文提出一种实用框架——MM2Latent——用于多模态图像生成与编辑。我们使用StyleGAN2作为图像生成器,FaRL用于文本编码,训练一种自编码器用于空间模态(如mask、sketch和3DMM)。我们提出一种策略,即训练一个映射网络将多模态输入映射到StyleGAN的w潜在空间。该框架1)消除了推理阶段的超参数和手动操作,2)确保快速推理速度,3)使能够编辑真实图像。广泛实验表明,我们的方法在多模态图像生成方面表现优于最新的GAN和扩散方法,也证明有效于多模态图像编辑,并且比GAN和扩散方法更快。我们将代码公开于:https://github.com/Open-Debin/MM2Latent

关键词

引用

@article{arxiv.2409.11010,
  title  = {MM2Latent: Text-to-facial image generation and editing in GANs with multimodal assistance},
  author = {Debin Meng and Christos Tzelepis and Ioannis Patras and Georgios Tzimiropoulos},
  journal= {arXiv preprint arXiv:2409.11010},
  year   = {2024}
}

备注

Accepted at ECCV 2024 AIM workshop