GeneFace:广义高保真音频驱动三维说话人脸合成
计算机视觉与模式识别
2023-02-01 v1
摘要
生成任意语音音频对应的照片级真实视频人像,是电影制作与虚拟现实中的关键问题。近来,若干工作探索在此任务中使用神经辐射场以提升三维真实感与图像保真度。然而,先前基于 NeRF 的方法对域外音频的泛化能力受限于训练数据规模较小。本文提出 GeneFace,一种广义且高保真的基于 NeRF 的说话人脸生成方法,可生成与各类域外音频对应的自然结果。具体而言,我们在一个大规模唇读语料库上学习变分运动生成器,并引入域自适应后处理网络对结果进行校准。此外,我们学习基于所预测面部运动的 NeRF 渲染器。提出一种头部感知的躯干-NeRF 以消除头-躯干分离问题。大量实验表明,相较先前方法,我们的方法实现了更具泛化性与高保真度的说话人脸生成。
引用
@article{arxiv.2301.13430,
title = {GeneFace: Generalized and High-Fidelity Audio-Driven 3D Talking Face Synthesis},
author = {Zhenhui Ye and Ziyue Jiang and Yi Ren and Jinglin Liu and JinZheng He and Zhou Zhao},
journal= {arXiv preprint arXiv:2301.13430},
year = {2023}
}
备注
Accepted by ICLR2023. Project page: https://geneface.github.io/