中文

基于自然视频的音频驱动 3D 面部动画

计算机视觉与模式识别 2023-06-21 v1

摘要

给定任意音频片段,音频驱动的 3D 面部动画旨在为 3D 头部生成逼真的唇部运动和面部表情。现有方法通常依赖于使用包含有限数量的音频-3D 扫描对的公开 3D 数据集来训练其模型。因此,它们的泛化能力仍然有限。在本文中,我们提出了一种新方法,利用自然 2D 说话头视频来训练我们的 3D 面部动画模型。大量易于获取的 2D 说话头视频为我们的模型提供了强大的泛化能力。通过将这些视频与现有的 3D 面部重建方法相结合,我们的模型在生成一致且高保真的唇形同步方面表现出色。此外,我们的模型能熟练捕捉不同个体的说话风格,使其能够生成具有独特个人风格的 3D 说话头。大量定性和定量实验结果证明了我们方法的优越性。

关键词

引用

@article{arxiv.2306.11541,
  title  = {Audio-Driven 3D Facial Animation from In-the-Wild Videos},
  author = {Liying Lu and Tianke Zhang and Yunfei Liu and Xuangeng Chu and Yu Li},
  journal= {arXiv preprint arXiv:2306.11541},
  year   = {2023}
}