中文

基于GAN的真实语音驱动人脸动画

计算机视觉与模式识别 2019-06-18 v1 机器学习 音频与语音处理

摘要

语音驱动人脸动画是基于语音信号自动合成说话角色的过程。该领域多数工作建立从音频特征到视觉特征的映射。这种方法常需使用计算机图形技术进行后处理,以产生真实但依赖于特定主体的结果。我们提出一个端到端系统,仅使用一张人物静图与包含语音的音频片段生成说话头视频,不依赖手工制作的中间特征。我们的方法生成的视频具有(a)与音频同步的唇部运动,以及(b)自然面部表情如眨眼与眉毛运动。我们的时序 GAN 使用 3 个判别器,分别致力于实现精细帧、音视觉同步与真实表情。我们通过消融研究量化模型中各部分的贡献,并提供模型潜在表示的洞见。所生成视频基于清晰度、重建质量、唇读准确率、同步性以及生成自然眨眼的能力进行评估。

关键词

引用

@article{arxiv.1906.06337,
  title  = {Realistic Speech-Driven Facial Animation with GANs},
  author = {Konstantinos Vougioukas and Stavros Petridis and Maja Pantic},
  journal= {arXiv preprint arXiv:1906.06337},
  year   = {2019}
}

备注

arXiv admin note: text overlap with arXiv:1805.09313