中文

FACEMUG:面向局部面部编辑的多模态生成与融合框架

计算机视觉与模式识别 2024-12-30 v1 多媒体

摘要

现有的面部编辑方法取得了显著成果,但它们往往在支持多模态条件局部面部编辑方面存在不足。一个显著证据是,经过几次增量编辑迭代后,输出图像质量急剧下降,因为它们不支持局部编辑。本文提出了一种新颖的多模态生成与融合框架,用于全局一致的局部面部编辑(FACEMUG),该框架能够处理多种输入模态,实现细粒度和语义操作,同时保持未编辑部分不变。不同模态,包括草图、语义图、颜色图、示例图像、文本和属性标签,擅长传达不同的条件细节,它们的协同作用可以为编辑过程提供更明确的指导。因此,我们将所有模态集成到一个统一的生成潜在空间中,以实现多模态局部面部编辑。具体来说,我们提出了一种新颖的多模态特征融合机制,利用多模态聚合和风格融合块在潜在空间和特征空间中融合面部先验和多模态信息。我们还引入了一种新颖的自监督潜在扭曲算法来纠正未对齐的面部特征,有效地将编辑图像的姿态转移到给定的潜在编码。我们通过大量实验和与最先进(SOTA)方法的比较来评估我们的FACEMUG。结果表明,FACEMUG在编辑质量、灵活性和语义控制方面具有优越性,使其成为各种局部面部编辑任务的有前途的解决方案。

关键词

引用

@article{arxiv.2412.19009,
  title  = {FACEMUG: A Multimodal Generative and Fusion Framework for Local Facial Editing},
  author = {Wanglong Lu and Jikai Wang and Xiaogang Jin and Xianta Jiang and Hanli Zhao},
  journal= {arXiv preprint arXiv:2412.19009},
  year   = {2024}
}

备注

Published at IEEE Transactions on Visualization and Computer Graphics; 21 pages, 26 figures