GSmoothFace:基于细粒度 3D 人脸引导的泛化平滑说话人脸生成
计算机视觉与模式识别
2023-12-13 v1
摘要
尽管现有的语音驱动说话人脸生成方法取得了显著进展,但由于需要针对特定虚拟人进行训练以及唇部运动不稳定,它们距离实际应用仍有较大差距。为了解决上述问题,我们提出了 GSmoothFace,一种由细粒度 3D 人脸模型引导的新型两阶段泛化说话人脸生成模型,它能够在保留说话人身份的同时合成平滑的唇部动态。我们提出的 GSmoothFace 模型主要由音频到表情预测(A2EP)模块和目标自适应人脸转换(TAFT)模块组成。具体而言,我们首先开发了 A2EP 模块,以预测与驱动语音同步的表情参数。它使用 Transformer 捕获长期音频上下文,并从细粒度的 3D 人脸顶点学习参数,从而实现准确且平滑的唇音同步性能。随后,由形态学增强人脸混合(MAFB)赋能的精心设计的 TAFT 模块,将预测的表情参数和目标视频作为输入,在不扭曲背景内容的情况下修改目标视频的人脸区域。TAFT 有效地利用了目标视频中的身份外观和背景上下文,这使得无需重新训练即可泛化到不同的说话人。定量和定性实验均证实了我们的方法在真实感、唇音同步和视觉质量方面的优越性。代码、数据和预训练模型请求请参见项目主页:https://zhanghm1995.github.io/GSmoothFace。
引用
@article{arxiv.2312.07385,
title = {GSmoothFace: Generalized Smooth Talking Face Generation via Fine Grained 3D Face Guidance},
author = {Haiming Zhang and Zhihao Yuan and Chaoda Zheng and Xu Yan and Baoyuan Wang and Guanbin Li and Song Wu and Shuguang Cui and Zhen Li},
journal= {arXiv preprint arXiv:2312.07385},
year = {2023}
}