基于身份与姿态自监督解耦的逼真人脸重演
计算机视觉与模式识别
2020-03-31 v1
摘要
近期工作已展示在几何引导(如人脸关键点或边界)监督下如何获得逼真的说话人脸图像。为减轻对手动标注的需求,本文提出一种新颖的自监督混合模型 (DAE-GAN),其在给定大量无标注视频时学习如何自然地重演人脸。我们的方法将两个形变自编码器与条件生成的最新进展相结合。一方面,我们采用形变自编码器解耦身份与姿态表示。说话人脸视频中的一个强先验是每帧可编码为两部分:一是视频特定的身份,二是各种姿态。受此启发,我们利用多帧形变自编码器为每个视频学习姿态不变的嵌入人脸。同时,提出多尺度形变自编码器来提取每帧的姿态相关信息。另一方面,条件生成器可增强细节与整体真实感,它利用解耦特征生成照片级真实且姿态相似的人脸图像。我们在 VoxCeleb1 与 RaFD 数据集上评估模型。实验结果表明了重演图像的优越质量以及身份间面部动作迁移的灵活性。
引用
@article{arxiv.2003.12957,
title = {Realistic Face Reenactment via Self-Supervised Disentangling of Identity and Pose},
author = {Xianfang Zeng and Yusu Pan and Mengmeng Wang and Jiangning Zhang and Yong Liu},
journal= {arXiv preprint arXiv:2003.12957},
year = {2020}
}