中文

AnyFace:自由风格文本到人脸合成与编辑

计算机视觉与模式识别 2022-03-30 v1

摘要

现有的文本到图像合成方法通常仅适用于训练数据集中的词汇。然而,人脸变化多端,难以用有限的词汇描述。因此,本文提出了首个自由风格文本到人脸方法,即 AnyFace,其支持更广阔的开放世界应用,如元宇宙、社交媒体、化妆品、法医学等。AnyFace 具有一种新颖的双流框架,可根据任意人脸描述进行人脸图像合成与编辑。具体而言,一条流执行文本到人脸生成,另一条流进行人脸图像重建。人脸文本与图像特征使用 CLIP (Contrastive Language-Image Pre-training,对比语言-图像预训练) 编码器提取。并设计了协同跨模态蒸馏 (CMD) 模块以对齐这两条流之间的语言与视觉特征。此外,提出了多样三元组损失 (DT loss) 来建模细粒度特征并提升人脸多样性。在 Multi-modal CelebA-HQ 和 CelebAText-HQ 上的大量实验表明,AnyFace 相比最先进方法具有显著优势。AnyFace 能够在输入描述的数量与内容上无任何约束的情况下,实现高质量、高分辨率、高多样性的人脸合成与编辑结果。

关键词

引用

@article{arxiv.2203.15334,
  title  = {AnyFace: Free-style Text-to-Face Synthesis and Manipulation},
  author = {Jianxin Sun and Qiyao Deng and Qi Li and Muyi Sun and Min Ren and Zhenan Sun},
  journal= {arXiv preprint arXiv:2203.15334},
  year   = {2022}
}