你说的是那个吗?
计算机视觉与模式识别
2017-07-19 v2
摘要
我们提出了一种生成说话人脸视频的方法。该方法以以下作为输入:(i) 目标人脸的静态图像,以及 (ii) 一段音频语音;并输出与目标人脸唇形与音频同步的视频。该方法实时运行,且适用于训练时未见过的人脸和音频。为实现此目的,我们提出了一种编码器-解码器 CNN 模型,该模型利用人脸与音频的联合嵌入来生成合成的说话人脸视频帧。模型在数十小时无标签视频上进行训练。我们还展示了使用不同人的语音对视频进行重新配音的结果。
引用
@article{arxiv.1705.02966,
title = {You said that?},
author = {Joon Son Chung and Amir Jamaludin and Andrew Zisserman},
journal= {arXiv preprint arXiv:1705.02966},
year = {2017}
}
备注
https://youtu.be/LeufDSb15Kc British Machine Vision Conference (BMVC), 2017