用于视觉语音合成的视频到视频翻译
计算机视觉与模式识别
2019-05-30 v1
摘要
尽管图像到图像翻译因生成对抗网络(GANs)的进展而取得显著成功,但视频域翻译的已知尝试极为有限。我们在视觉语音生成背景下研究视频到视频翻译任务,其目标是将任意 spoken 单词的输入视频变换为不同单词的输出视频。这是多域翻译,其中每个单词构成发该词视频的一个域。将最先进的图像到图像翻译模型(StarGAN)适配于此设定在词汇量较大时表现不佳。作为替代,我们提出使用单词的字符编码,并设计一种新颖的基于字符的GANs架构用于视频到视频翻译,称为视觉语音GAN(ViSpGAN)。我们首次展示了词汇量为500词的视频到视频翻译。
引用
@article{arxiv.1905.12043,
title = {Video-to-Video Translation for Visual Speech Synthesis},
author = {Michail C. Doukas and Viktoriia Sharmanska and Stefanos Zafeiriou},
journal= {arXiv preprint arXiv:1905.12043},
year = {2019}
}