可控图像到视频的翻译:以面部表情生成为例
计算机视觉与模式识别
2018-08-10 v1
摘要
深度学习的近期进展使得利用神经网络生成照片级真实图像、甚至从输入视频片段外推视频帧成为可能。在本文中,为了进一步探索此问题以及出于我们对实际应用的兴趣,我们研究图像到视频的翻译,并特别关注面部表情视频。与图像到图像的翻译相比,该问题以另一个时间维度对深度神经网络提出挑战。此外,其单一输入图像使得大多数依赖循环模型的现有视频生成方法失效。我们提出一种用户可控的方法,以从单张人脸图像生成任意长度的视频片段。表情的长度与类型由用户控制。为此,我们设计了一种新颖的神经网络架构,能将用户输入整合进其跳跃连接中,并提出了针对该神经网络对抗训练方法的若干改进。实验与用户研究验证了我们所提方法的有效性。特别地,我们想强调,即便对于野外的 face 图像(从网络下载及作者本人的照片),我们的模型也能生成高质量面部表情视频,其中约 50% 被 Amazon Mechanical Turk 工作者标注为真实。
引用
@article{arxiv.1808.02992,
title = {Controllable Image-to-Video Translation: A Case Study on Facial Expression Generation},
author = {Lijie Fan and Wenbing Huang and Chuang Gan and Junzhou Huang and Boqing Gong},
journal= {arXiv preprint arXiv:1808.02992},
year = {2018}
}
备注
10 pages