M$^3$Face:用于人脸生成与编辑的统一多模态多语言框架
计算机视觉与模式识别
2024-02-06 v1 计算与语言
多媒体
摘要
人脸生成与编辑是计算机视觉和数字世界中的一项重要任务。最近的研究在多模态人脸生成与编辑方面取得了显著进展,例如利用人脸分割来指导图像生成。然而,对于某些用户来说,手动创建这些条件模态可能具有挑战性。因此,我们引入了 M3Face,一个用于可控人脸生成与编辑的统一多模态多语言框架。该框架允许用户仅使用文本输入即可自动生成控制模态(例如语义分割或面部标志点),并随后生成人脸图像。我们进行了广泛的定性和定量实验,以展示我们框架的人脸生成与编辑能力。此外,我们提出了 M3CelebA 数据集,这是一个大规模的多模态和多语言人脸数据集,包含高质量图像、语义分割、面部标志点以及每张图像的多种语言描述。代码和数据集将在发表后发布。
引用
@article{arxiv.2402.02369,
title = {M$^3$Face: A Unified Multi-Modal Multilingual Framework for Human Face Generation and Editing},
author = {Mohammadreza Mofayezi and Reza Alipour and Mohammad Ali Kakavand and Ehsaneddin Asgari},
journal= {arXiv preprint arXiv:2402.02369},
year = {2024}
}