ObamaNet:从文本生成照片级真实感唇形同步视频
计算机视觉与模式识别
2018-01-08 v1
摘要
我们提出 ObamaNet,这是首个从任意新文本生成音频及同步照片级真实感唇形同步视频的架构。与其他已发表的唇形同步方法不同,我们的方法仅由完全可训练的神经网络模块组成,不依赖任何传统计算机图形学方法。更确切地说,我们使用三个主要模块:基于 Char2Wav 的文本转语音网络、用于生成与音频同步的嘴部关键点的时间延迟 LSTM,以及基于 Pix2Pix 的以关键点为条件生成视频帧的网络。
引用
@article{arxiv.1801.01442,
title = {ObamaNet: Photo-realistic lip-sync from text},
author = {Rithesh Kumar and Jose Sotelo and Kundan Kumar and Alexandre de Brebisson and Yoshua Bengio},
journal= {arXiv preprint arXiv:1801.01442},
year = {2018}
}