中文

基于 Seq2Seq 与 GAN 模型的神经虚拟主播合成器

计算机视觉与模式识别 2019-09-13 v2

摘要

本文提出了一种新颖的框架,用于生成主播朗读特定新闻时的逼真人脸视频。该任务亦称为虚拟主播。给定若干段文字,我们首先利用预训练的 Word2Vec 模型将每个词嵌入为向量;然后利用基于 Seq2Seq 的模型将这些词嵌入翻译为目标主播的动作单元与头部姿态;这些动作单元与头部姿态将与人脸关键点以及前 nn 帧合成图像拼接,该拼接结果作为基于 Pix2PixHD 的模型的输入,以合成虚拟主播的逼真人脸图像。实验结果表明我们的框架对于虚拟主播的合成是可行的。

关键词

引用

@article{arxiv.1908.07262,
  title  = {A Neural Virtual Anchor Synthesizer based on Seq2Seq and GAN Models},
  author = {Zipeng Wang and Zhaoxiang Liu and Zezhou Chen and Huan Hu and Shiguo Lian},
  journal= {arXiv preprint arXiv:1908.07262},
  year   = {2019}
}

备注

Accepted to ISMAR 2019