中文

Media2Face:基于多模态引导的协同语音面部动画生成

计算机视觉与模式识别 2024-01-31 v2 图形学

摘要

从语音合成 3D 面部动画引起了广泛关注。由于高质量 4D 面部数据和标注丰富的多模态标签的稀缺,以往方法往往存在真实感有限和条件控制缺乏灵活性的问题。我们通过一个三部曲来解决这一挑战。我们首先引入了广义神经参数化面部资产(GNPFA),这是一种高效的自编码器变体,能将面部几何形状和图像映射到高度泛化的表情潜在空间,实现表情与身份的解耦。然后,我们利用 GNPFA 从大量视频中提取高质量表情和准确的头部姿态。这推出了 M2F-D 数据集,这是一个大规模、多样化且达到扫描级别的协同语音 3D 面部动画数据集,带有标注良好的情感和风格标签。最后,我们提出了 Media2Face,一种在 GNPFA 潜在空间中的扩散模型,用于协同语音面部动画生成,接受来自音频、文本和图像的丰富多模态引导。大量实验表明,我们的模型不仅在面部动画合成中实现了高保真度,还拓宽了 3D 面部动画在表现力和风格适应性方面的范围。

关键词

引用

@article{arxiv.2401.15687,
  title  = {Media2Face: Co-speech Facial Animation Generation With Multi-Modality Guidance},
  author = {Qingcheng Zhao and Pengyu Long and Qixuan Zhang and Dafei Qin and Han Liang and Longwen Zhang and Yingliang Zhang and Jingyi Yu and Lan Xu},
  journal= {arXiv preprint arXiv:2401.15687},
  year   = {2024}
}

备注

Project Page: https://sites.google.com/view/media2face