基于 Seq2Seq 与 GAN 模型的神经虚拟主播合成器
计算机视觉与模式识别
2019-09-13 v2
摘要
本文提出了一种新颖的框架,用于生成主播朗读特定新闻时的逼真人脸视频。该任务亦称为虚拟主播。给定若干段文字,我们首先利用预训练的 Word2Vec 模型将每个词嵌入为向量;然后利用基于 Seq2Seq 的模型将这些词嵌入翻译为目标主播的动作单元与头部姿态;这些动作单元与头部姿态将与人脸关键点以及前 帧合成图像拼接,该拼接结果作为基于 Pix2PixHD 的模型的输入,以合成虚拟主播的逼真人脸图像。实验结果表明我们的框架对于虚拟主播的合成是可行的。
引用
@article{arxiv.1908.07262,
title = {A Neural Virtual Anchor Synthesizer based on Seq2Seq and GAN Models},
author = {Zipeng Wang and Zhaoxiang Liu and Zezhou Chen and Huan Hu and Shiguo Lian},
journal= {arXiv preprint arXiv:1908.07262},
year = {2019}
}
备注
Accepted to ISMAR 2019