Face-MakeUpV2:面部一致性学习用于可控文本到图像生成
计算机视觉与模式识别
2025-12-02 v2 人工智能
图像与视频处理
摘要
在面部图像生成中,当前的文本到图像模型常常在响应局部语义指令时出现面部属性泄漏和不足的物理一致性问题。本研究提出了 Face-MakeUpV2,一种旨在保持面部 ID 和物理特征与参考图像一致性的面部图像生成模型。首先,我们构建了一个大规模数据集 FaceCaptionMask-1M,包含约百万图像-文本-掩码三元组,为局部语义指令提供精确的空间监督。其次,我们采用通用的文本到图像预训练模型作为骨干网络,引入两个互补的面部信息注入通道:用于整合图像物理特征的 3D 面部渲染通道和用于注入全局面部特征的全局面部特征通道。再次,我们构建了两个优化目标,用于监督式学习:一种是模型嵌入空间中的语义对齐,以缓解属性泄漏问题;另一种是面部图像上的感知损失,以保持 ID 一致性。大量实验表明,Face-MakeUpV2 在保持面部 ID 和维持参考图像物理一致性方面综合性能居于最前。这些结果凸显了 Face-MakeUpV2 在实际应用中实现可靠且可控的面部编辑的潜在价值。
引用
@article{arxiv.2510.21775,
title = {Face-MakeUpV2: Facial Consistency Learning for Controllable Text-to-Image Generation},
author = {Dawei Dai and Yinxiu Zhou and Chenghang Li and Guolai Jiang and Chengfang Zhang},
journal= {arXiv preprint arXiv:2510.21775},
year = {2025}
}
备注
Some errors in the critical data presented in Table 1 and Table 2