中文

可控图像到视频的翻译:以面部表情生成为例

计算机视觉与模式识别 2018-08-10 v1

摘要

深度学习的近期进展使得利用神经网络生成照片级真实图像、甚至从输入视频片段外推视频帧成为可能。在本文中,为了进一步探索此问题以及出于我们对实际应用的兴趣,我们研究图像到视频的翻译,并特别关注面部表情视频。与图像到图像的翻译相比,该问题以另一个时间维度对深度神经网络提出挑战。此外,其单一输入图像使得大多数依赖循环模型的现有视频生成方法失效。我们提出一种用户可控的方法,以从单张人脸图像生成任意长度的视频片段。表情的长度与类型由用户控制。为此,我们设计了一种新颖的神经网络架构,能将用户输入整合进其跳跃连接中,并提出了针对该神经网络对抗训练方法的若干改进。实验与用户研究验证了我们所提方法的有效性。特别地,我们想强调,即便对于野外的 face 图像(从网络下载及作者本人的照片),我们的模型也能生成高质量面部表情视频,其中约 50% 被 Amazon Mechanical Turk 工作者标注为真实。

关键词

引用

@article{arxiv.1808.02992,
  title  = {Controllable Image-to-Video Translation: A Case Study on Facial Expression Generation},
  author = {Lijie Fan and Wenbing Huang and Chuang Gan and Junzhou Huang and Boqing Gong},
  journal= {arXiv preprint arXiv:1808.02992},
  year   = {2018}
}

备注

10 pages