中文

一眼生成唇部运动

计算机视觉与模式识别 2018-05-23 v3

摘要

跨模态生成是一个新兴课题,旨在基于不同模态的信息合成某一模态的数据。在本文中,我们考虑这样一个任务:给定任意音频语音和任意目标身份的一张唇部图像,生成该目标身份说出该语音的合成唇部运动。要在此任务中表现良好,模型不可避免地不仅需要考虑目标身份的保留、合成图像的逼真度、序列中唇部图像的一致性与平滑度,更重要的是,还需要学习音频语音与唇部运动之间的相关性。为了解决这些综合性问题,我们探索了在构建和训练唇部运动生成器网络时音视频相关性的最佳建模方式。具体而言,我们设计了一种融合音频和图像嵌入的方法以一次性生成多张唇部图像,并提出了一种新颖的相关性损失来同步唇部变化与语音变化。我们的最终模型结合了四种损失以全面考虑唇部运动的生成;该模型以端到端方式进行训练,并且对唇形、视角和不同面部特征具有鲁棒性。在从实验室录制到自然环境下采集的三个数据集上的深入实验表明,我们的模型显著优于扩展至该任务的其他 state-of-the-art 方法。

关键词

引用

@article{arxiv.1803.10404,
  title  = {Lip Movements Generation at a Glance},
  author = {Lele Chen and Zhiheng Li and Ross K. Maddox and Zhiyao Duan and Chenliang Xu},
  journal= {arXiv preprint arXiv:1803.10404},
  year   = {2018}
}