中文

由单幅图像与 landmarks 生成人脸视频

计算机视觉与模式识别 2019-04-29 v1

摘要

本文关注一个具有挑战性的问题:仅给定一幅图像和由一组稀疏 landmarks 编码的通用面部运动,生成可形变人脸的完整图像序列。为此,我们基于 pix2pix、CycleGAN 和 StarGAN 等近期图像到图像翻译的突破——它们学习深度卷积神经网络(DCNNs)以将不同域(即具有不同标签)之间对齐的图像对或图像进行映射——并提出一种不再由标签驱动而由空间图、即面部 landmarks 驱动的新架构。具体而言,我们提出 MotionGAN,其根据目标 landmarks 的热图将输入人脸图像变换为新人脸图像。我们展示了使用单幅图像和一组目标 landmarks 即可创建非常真实的人脸视频。此外,我们的方法可根据 landmarks(例如表情、说话等)以任意运动编辑人脸图像,相较于基于离散表情、音频或动作单元的模型,这为人脸编辑、表情迁移、人脸视频生成等提供了更大的灵活性。

关键词

引用

@article{arxiv.1904.11521,
  title  = {Face Video Generation from a Single Image and Landmarks},
  author = {Kritaphat Songsri-in and Stefanos Zafeiriou},
  journal= {arXiv preprint arXiv:1904.11521},
  year   = {2019}
}