中文

面向非受限视频语音驱动唇形生成:仅需一个唇形同步专家

计算机视觉与模式识别 2020-08-25 v1 机器学习 声音 音频与语音处理

摘要

在本工作中,我们研究将任意身份的说话人脸视频进行唇形同步以匹配目标语音段的问题。现有方法在静态图像或训练阶段见过的特定人物视频上能生成准确的唇部运动,但无法在动态、无约束的说话人脸视频中准确变形任意身份的唇部运动,导致视频的很大部分与新音频不同步。我们找出了与此相关的关键原因,并通过从一个强大的唇形同步判别器中学习加以解决。接下来,我们提出新的、严格的评测基准与指标,以准确度量无约束视频中的唇形同步。在我们具有挑战性的基准上的大量定量评测表明,我们的Wav2Lip模型生成视频的唇形同步精度几乎与真实同步视频一样好。我们在网站 \url{cvit.iiit.ac.in/research/projects/cvit-projects/a-lip-sync-expert-is-all-you-need-for-speech-to-lip-generation-in-the-wild} 提供了演示视频,清晰展示了我们的Wav2Lip模型与评测基准的显著影响。代码与模型发布于该GitHub仓库:\url{github.com/Rudrabha/Wav2Lip}。您也可通过该链接试用交互式演示:\url{bhaasha.iiit.ac.in/lipsync}。

关键词

引用

@article{arxiv.2008.10010,
  title  = {A Lip Sync Expert Is All You Need for Speech to Lip Generation In The Wild},
  author = {K R Prajwal and Rudrabha Mukhopadhyay and Vinay Namboodiri and C V Jawahar},
  journal= {arXiv preprint arXiv:2008.10010},
  year   = {2020}
}

备注

9 pages (including references), 3 figures, Accepted in ACM Multimedia, 2020