中文

神经声音木偶:音频驱动的面部重演

计算机视觉与模式识别 2020-07-30 v2 图形学

摘要

我们提出 Neural Voice Puppetry,一种用于音频驱动面部视频合成的新方法。给定源人物或数字助理的音频序列,我们生成与目标人物同步且照片级真实的输出视频,其与源输入的音频同步。该音频驱动面部重演由一个采用隐空间 3D 人脸模型表示的深度神经网络驱动。通过底层 3D 表示,模型固有地学习时间稳定性,同时我们利用神经渲染生成照片级真实的输出帧。我们的方法可泛化至不同人物,允许我们用任意未知源演员甚至可利用标准文本转语音方法生成的合成声音来合成目标演员的视频。Neural Voice Puppetry 具有多种用例,包括音频驱动视频化身、视频配音以及说话头部的文本驱动视频合成。我们在一系列音频与文本驱动的木偶示例中展示了方法的能力,包括与最先进技术的比较及一项用户研究。

关键词

引用

@article{arxiv.1912.05566,
  title  = {Neural Voice Puppetry: Audio-driven Facial Reenactment},
  author = {Justus Thies and Mohamed Elgharib and Ayush Tewari and Christian Theobalt and Matthias Nießner},
  journal= {arXiv preprint arXiv:1912.05566},
  year   = {2020}
}

备注

Video: https://youtu.be/s74_yQiJMXA Project/Demo/Code: https://justusthies.github.io/posts/neural-voice-puppetry/