Face-MakeUp: 多模态人脸提示用于文本到图像生成
计算机视觉与模式识别
2025-01-07 v1 人工智能
摘要
人脸图像具有广泛的实际应用。尽管当前大规模文本图像扩散模型表现出强大的生成能力,但仅通过文本提示难以生成所需的人脸图像。图像提示是一种合理的选择。然而,此类方法通常侧重于通用领域。本文旨在优化图像化妆技术以生成所需的人脸图像。具体而言,我们(1)基于LAION-Face构建了400万组高质量人脸图像文本对数据集(FaceCaptionHQ-4M)用于训练Face-MakeUp模型;(2)为保持参考人脸图像的一致性,提取/学习多尺度内容特征和姿态特征,将其整合到扩散模型中以增强人脸身份特征的保持。在两个与人脸相关的测试数据集上进行的验证表明,Face-MakeUp能够实现最佳的综合性能。所有代码均可访问于:https://github.com/ddw2AIGROUP2CQUPT/Face-MakeUp
引用
@article{arxiv.2501.02523,
title = {Face-MakeUp: Multimodal Facial Prompts for Text-to-Image Generation},
author = {Dawei Dai and Mingming Jia and Yinxiu Zhou and Hang Xing and Chenghang Li},
journal= {arXiv preprint arXiv:2501.02523},
year = {2025}
}