中文

基于音频驱动且具有多样而逼真面部动画的说话人脸生成

计算机视觉与模式识别 2023-04-19 v1

摘要

音频驱动的说话人脸生成旨在合成与音频相对应的具有逼真面部动画(包括准确的唇部运动、生动的面部表情细节和自然头部姿态)的说话人脸,近年来取得了快速进展。然而,大多数现有工作仅关注生成唇部运动,而未处理紧密相关的面部表情,这极大降低了生成人脸的真实感。本文提出DIRFA,一种可从同一驱动音频生成具有多样而逼真面部动画的说话人脸的新方法。为适配同一音频下合理面部动画的公平变化,我们设计了一个基于transformer的概率映射网络,该网络可建模以输入音频为条件的变分面部动画分布,并自回归地将音频信号转换为面部动画序列。此外,我们在映射网络中引入了时间偏置掩码,得以建模面部动画的时间依赖性并生成时间平滑的面部动画序列。利用生成的面部动画序列与源图像,可通过通用生成网络合成照片级真实感说话人脸。大量实验表明,DIRFA能有效生成具有逼真面部动画的说话人脸。

关键词

引用

@article{arxiv.2304.08945,
  title  = {Audio-Driven Talking Face Generation with Diverse yet Realistic Facial Animations},
  author = {Rongliang Wu and Yingchen Yu and Fangneng Zhan and Jiahui Zhang and Xiaoqin Zhang and Shijian Lu},
  journal= {arXiv preprint arXiv:2304.08945},
  year   = {2023}
}