GeneFace++:广义且稳定的实时音频驱动三维说话人脸生成
计算机视觉与模式识别
2023-05-02 v1
摘要
以任意语音音频生成说话人物肖像,是数字人与元宇宙领域的一个关键问题。现代说话人脸生成方法期望实现广义的音频-唇形同步、良好的视频质量以及较高的系统效率。近年来,神经辐射场(NeRF)因能以数分钟训练视频实现高保真且三维一致的说话人脸生成,而成为该领域流行的渲染技术。然而,基于 NeRF 的方法仍存在若干挑战:1)在唇形同步方面,难以生成具有高时间一致性与音频-唇形准确性的长面部运动序列;2)在视频质量方面,由于训练渲染器的数据有限,其对域外输入条件敏感,偶尔产生糟糕的渲染结果;3)在系统效率方面,原始 NeRF 缓慢的训练与推理速度严重阻碍其在现实应用中的使用。本文提出 GeneFace++ 以应对这些挑战:1)利用音高轮廓作为辅助特征,并在面部运动预测过程中引入时间损失;2)提出一种标志点局部线性嵌入方法,以调节预测运动序列中的离群值,避免鲁棒性问题;3)设计一种计算高效的基于 NeRF 的运动到视频渲染器,实现快速训练与实时推理。借助这些设置,GeneFace++ 成为首个实现稳定且实时说话人脸生成并具备广义音频-唇形同步的基于 NeRF 的方法。大量实验表明,我们的方法在主观与客观评价上均优于当前最优基线。视频样本见 https://genefaceplusplus.github.io 。
引用
@article{arxiv.2305.00787,
title = {GeneFace++: Generalized and Stable Real-Time Audio-Driven 3D Talking Face Generation},
author = {Zhenhui Ye and Jinzheng He and Ziyue Jiang and Rongjie Huang and Jiawei Huang and Jinglin Liu and Yi Ren and Xiang Yin and Zejun Ma and Zhou Zhao},
journal= {arXiv preprint arXiv:2305.00787},
year = {2023}
}
备注
18 Pages, 7 figures