中文

Face-MakeUp: 多模态人脸提示用于文本到图像生成

计算机视觉与模式识别 2025-01-07 v1 人工智能

摘要

人脸图像具有广泛的实际应用。尽管当前大规模文本图像扩散模型表现出强大的生成能力,但仅通过文本提示难以生成所需的人脸图像。图像提示是一种合理的选择。然而,此类方法通常侧重于通用领域。本文旨在优化图像化妆技术以生成所需的人脸图像。具体而言,我们(1)基于LAION-Face构建了400万组高质量人脸图像文本对数据集(FaceCaptionHQ-4M)用于训练Face-MakeUp模型;(2)为保持参考人脸图像的一致性,提取/学习多尺度内容特征和姿态特征,将其整合到扩散模型中以增强人脸身份特征的保持。在两个与人脸相关的测试数据集上进行的验证表明,Face-MakeUp能够实现最佳的综合性能。所有代码均可访问于:https://github.com/ddw2AIGROUP2CQUPT/Face-MakeUp

关键词

引用

@article{arxiv.2501.02523,
  title  = {Face-MakeUp: Multimodal Facial Prompts for Text-to-Image Generation},
  author = {Dawei Dai and Mingming Jia and Yinxiu Zhou and Hang Xing and Chenghang Li},
  journal= {arXiv preprint arXiv:2501.02523},
  year   = {2025}
}