中文

X2Face:一种利用图像、音频与位姿编码控制人脸生成的网络

计算机视觉与模式识别 2018-07-30 v1

摘要

本文的目标是构建一个神经网络模型,利用另一人脸或模态(如音频)来控制给定人脸的位姿与表情。该模型随后可用于轻量且精细的视频与图像编辑。我们作出以下三点贡献。首先,我们引入一个网络 X2Face,其可使用驱动帧中的另一人脸来控制源人脸(由一帧或多帧指定),生成具有源帧身份但驱动帧中人脸位姿与表情的帧。其次,我们提出一种利用大规模视频数据对网络进行完全自监督训练的方法。第三,我们展示生成过程可由其他模态(如音频或位姿编码)驱动,而无需对网络进一步训练。以另一人脸驱动人脸的生成结果相较于最先进的自监督/监督方法进行了比较。我们表明我们的方法比其他方法更鲁棒,因其对输入数据所作假设更少。我们还展示了使用我们的框架进行视频人脸编辑的示例。

关键词

引用

@article{arxiv.1807.10550,
  title  = {X2Face: A network for controlling face generation by using images, audio, and pose codes},
  author = {Olivia Wiles and A. Sophia Koepke and Andrew Zisserman},
  journal= {arXiv preprint arXiv:1807.10550},
  year   = {2018}
}

备注

To appear in ECCV 2018. Accompanying video: http://www.robots.ox.ac.uk/~vgg/research/unsup_learn_watch_faces/x2face.html