中文

基于学习的个性化头部姿态驱动的音频驱动说话人脸视频生成

计算机视觉与模式识别 2020-03-06 v2 图形学

摘要

现实世界中的说话人脸常伴随自然的头部运动。然而,大多数现有说话人脸视频生成方法仅考虑固定头部姿态下的面部动画。本文通过提出一种深度神经网络模型来解决该问题,该模型以源人物的音频信号 A 和目标人物的极短视频 V 作为输入,输出合成的具有个性化头部姿态(利用 V 中的视觉信息)、表情与唇形同步(综合考虑 A 与 V)的高质量说话人脸视频。我们工作中最具挑战性的问题在于自然姿态常引起面内与面外头部旋转,使合成的说话人脸视频远不真实。为应对此挑战,我们重建三维面部动画并将其重新渲染为合成帧。为将这些帧微调为具有平滑背景过渡的真实帧,我们提出一种新颖的记忆增强 GAN 模块。通过先在公开数据集上训练通用映射,再利用目标人物的输入短视频微调该映射,我们开发了一种仅需少量帧(约 300 帧)即可学习包含头部姿态的个性化说话行为的有效策略。大量实验与两项用户研究表明,我们的方法能生成高质量的(即个性化头部运动、表情与良好唇形同步)说话人脸视频,其外观自然且比最先进方法具有更显著的头部运动效果。

关键词

引用

@article{arxiv.2002.10137,
  title  = {Audio-driven Talking Face Video Generation with Learning-based Personalized Head Pose},
  author = {Ran Yi and Zipeng Ye and Juyong Zhang and Hujun Bao and Yong-Jin Liu},
  journal= {arXiv preprint arXiv:2002.10137},
  year   = {2020}
}

备注

12 pages, 9 figures