中文

你说的是那个吗?

计算机视觉与模式识别 2017-07-19 v2

摘要

我们提出了一种生成说话人脸视频的方法。该方法以以下作为输入:(i) 目标人脸的静态图像,以及 (ii) 一段音频语音;并输出与目标人脸唇形与音频同步的视频。该方法实时运行,且适用于训练时未见过的人脸和音频。为实现此目的,我们提出了一种编码器-解码器 CNN 模型,该模型利用人脸与音频的联合嵌入来生成合成的说话人脸视频帧。模型在数十小时无标签视频上进行训练。我们还展示了使用不同人的语音对视频进行重新配音的结果。

关键词

引用

@article{arxiv.1705.02966,
  title  = {You said that?},
  author = {Joon Son Chung and Amir Jamaludin and Andrew Zisserman},
  journal= {arXiv preprint arXiv:1705.02966},
  year   = {2017}
}

备注

https://youtu.be/LeufDSb15Kc British Machine Vision Conference (BMVC), 2017