SadTalker:学习逼真的 3D 运动系数用于风格化音频驱动单图像说话人脸动画
计算机视觉与模式识别
2023-03-14 v2
摘要
通过一张人脸图像和一段语音音频生成说话头部视频仍包含诸多挑战,例如不自然的头部运动、扭曲的表情以及身份改变。我们认为这些问题主要源于从耦合的 2D 运动场中学习。另一方面,显式使用 3D 信息也存在表情僵硬与视频不连贯的问题。我们提出 SadTalker,它从音频生成 3DMM 的 3D 运动系数(头部姿态、表情),并隐式调制一种新颖的 3D 感知人脸渲染器用于说话头部生成。为学习逼真的运动系数,我们显式地分别建模音频与不同类型运动系数之间的联系。具体而言,我们提出 ExpNet,通过蒸馏系数与 3D 渲染人脸两者从音频学习准确的面部表情。至于头部姿态,我们通过条件 VAE 设计 PoseVAE 以合成不同风格的头部运动。最后,生成的 3D 运动系数被映射到所提人脸渲染器的无监督 3D 关键点空间,并合成最终视频。我们进行了大量实验以证明我们的方法在运动与视频质量方面的优越性。
引用
@article{arxiv.2211.12194,
title = {SadTalker: Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation},
author = {Wenxuan Zhang and Xiaodong Cun and Xuan Wang and Yong Zhang and Xi Shen and Yu Guo and Ying Shan and Fei Wang},
journal= {arXiv preprint arXiv:2211.12194},
year = {2023}
}
备注
Accepted by CVPR 2023, Project page: https://sadtalker.github.io, Code: https://github.com/Winfredy/SadTalker