中文

基于多模态情感空间学习的高保真广义情感说话人脸生成

计算机视觉与模式识别 2023-06-01 v2

摘要

近来,情感说话人脸生成受到相当关注。然而,现有方法仅采用独热编码、图像或音频作为情感条件,因而在实际应用中缺乏灵活控制,且因语义有限而无法处理未见过的情感风格。它们或忽略单次设定,或忽视生成人脸的质量。本文提出一种更灵活且更具泛化性的框架。具体而言,我们在文本提示中补充情感风格,并使用对齐多模态情感编码器将文本、图像与音频情感模态嵌入统一空间,该空间从 CLIP 继承了丰富的语义先验。因此,有效的多模态情感空间学习使我们的方法在测试时支持任意情感模态,并能泛化至未见情感风格。此外,提出情感感知音频到 3DMM 转换器,以连接情感条件与音频序列至结构表示。随后设计基于风格的髙保真情感人脸生成器,以生成任意高分辨率逼真身份。我们的纹理生成器以残差方式分层学习流场与动画人脸。大量实验证明了该方法在情感控制上的灵活性与泛化性,以及高质量人脸合成的有效性。

关键词

引用

@article{arxiv.2305.02572,
  title  = {High-fidelity Generalized Emotional Talking Face Generation with Multi-modal Emotion Space Learning},
  author = {Chao Xu and Junwei Zhu and Jiangning Zhang and Yue Han and Wenqing Chu and Ying Tai and Chengjie Wang and Zhifeng Xie and Yong Liu},
  journal= {arXiv preprint arXiv:2305.02572},
  year   = {2023}
}