基于对抗学习与三维稠密几何引导的人脸表情合成
计算机视觉与模式识别
2020-10-01 v1
摘要
由于面部肌肉产生的细粒度形状变化以及缺乏用于监督学习的输入输出配对,操纵面部表情是一项具有挑战性的任务。与使用生成对抗网络(GAN)的先前方法不同——后者依赖循环一致性损失或稀疏几何(关键点)损失进行表情合成——我们提出了一种新颖的 GAN 框架,以利用三维稠密(深度与表面法线)信息进行表情操纵。然而,包含带有表情标注的 RGB 图像及其对应深度图的大规模数据集尚不可用。为此,我们提出使用现成的最先进三维重建模型来估计深度,并在人工数据清理过程后创建一个大规模的 RGB-深度数据集。我们利用该数据集通过对抗学习最小化新颖的深度一致性损失(注意我们对于生成的人脸图像没有真实深度图)以及判别器上合成数据的深度分类损失。此外,为提高泛化能力并降低深度参数的偏差,我们提出在框架的判别器侧使用一种新颖的置信度正则化器。我们在两个公开可用的具有挑战性的人脸表情基准 AffectNet 和 RaFD 上广泛进行了定量与定性评估。我们的实验表明,所提方法大幅优于具有竞争力的基线方法和现有最佳方法。
引用
@article{arxiv.2009.14798,
title = {3D Dense Geometry-Guided Facial Expression Synthesis by Adversarial Learning},
author = {Rumeysa Bodur and Binod Bhattarai and Tae-Kyun Kim},
journal= {arXiv preprint arXiv:2009.14798},
year = {2020}
}