用于说话头视频生成的深度感知生成对抗网络
计算机视觉与模式识别
2022-03-16 v2
摘要
说话头视频生成旨在生成一段合成人脸视频,其身份与姿态信息分别来自给定的源图像与驱动视频。该任务的现有工作严重依赖从输入图像中学到的 2D 表征(如外观与运动)。然而,稠密 3D 面部几何(如逐像素深度)对该任务极为重要,因为它尤其有助于我们从根本上生成准确的 3D 人脸结构,并从可能杂乱的背景中区分噪声信息。尽管如此,稠密 3D 几何标注对视频而言成本高昂,且该视频生成任务通常无法获得此类标注。本文中,我们首先引入一种自监督几何学习方法,无需任何昂贵的 3D 标注数据即可从人脸视频中自动恢复稠密 3D 几何(即深度)。基于学到的稠密深度图,我们进一步提出利用它们估计捕获人头关键运动的稀疏面部关键点。以更稠密的方式,深度还被用于学习 3D 感知的跨模态(即外观与深度)注意力,以引导用于形变源图像表征的运动场生成。所有这些贡献构成了一个新颖的用于说话头生成的深度感知生成对抗网络(DaGAN)。大量实验表明,我们提出的方法能生成高度逼真的人脸,并在未见人脸上取得显著效果。
引用
@article{arxiv.2203.06605,
title = {Depth-Aware Generative Adversarial Network for Talking Head Video Generation},
author = {Fa-Ting Hong and Longhao Zhang and Li Shen and Dan Xu},
journal= {arXiv preprint arXiv:2203.06605},
year = {2022}
}
备注
15 Pages; Accepted by CVPR 2022