中文

NeRFFaceSpeech:基于生成先验的单样本音频驱动 3D 对话头部合成

计算机视觉与模式识别 2024-05-13 v2

摘要

音频驱动的对话头部生成正从 2D 向 3D 内容推进。值得注意的是,神经辐射场 (NeRF) 作为合成高质量 3D 对话头部输出的手段备受瞩目。不幸的是,这种基于 NeRF 的方法通常需要为每个身份提供大量配对的视听数据,从而限制了该方法的可扩展性。尽管已有尝试利用单张图像生成音频驱动的 3D 对话头部动画,但由于图像中被遮挡区域的信息不足,结果往往不尽如人意。在本文中,我们主要关注解决在单样本、音频驱动领域中被忽视的 3D 一致性问题,该领域的面部动画主要在正面视角下合成。我们提出了一种新方法 NeRFFaceSpeech,能够生成高质量的 3D 感知对话头部。结合生成模型的先验知识与 NeRF,我们的方法能够构建与单张图像对应的 3D 一致面部特征空间。我们的空间同步方法采用参数化面部模型的音频相关顶点动力学,通过光线形变将静态图像特征转化为动态视觉效果,确保逼真的 3D 面部运动。此外,我们引入了 LipaintNet,用于补充内嘴区域缺失的信息,这些信息无法从给定的单张图像中获取。该网络以自监督方式进行训练,利用生成能力而无需额外数据。综合实验表明,与以往方法相比,我们的方法在从单张图像生成具有增强 3D 一致性的音频驱动对话头部方面具有优越性。此外,我们首次引入了一种定量测量模型对姿态变化鲁棒性的方法,而这以前只能定性进行。

关键词

引用

@article{arxiv.2405.05749,
  title  = {NeRFFaceSpeech: One-shot Audio-driven 3D Talking Head Synthesis via Generative Prior},
  author = {Gihoon Kim and Kwanggyoon Seo and Sihun Cha and Junyong Noh},
  journal= {arXiv preprint arXiv:2405.05749},
  year   = {2024}
}

备注

11 pages, 5 figures