中文

FaceDiffuser:基于扩散的语音驱动三维面部动画合成

计算机视觉与模式识别 2023-09-21 v1 人工智能 图形学

摘要

语音驱动的三维面部动画合成在工业界与研究中均是一项具有挑战性的任务。近期方法大多聚焦于确定性深度学习方法,即给定语音输入,输出总是相同的。然而现实中,遍布面部的非言语面部线索本质上具有非确定性。此外,多数方法聚焦于基于三维顶点的数据集,且与带绑定角色(rigged characters)的现有面部动画流程兼容的方法稀缺。为消除这些问题,我们提出 FaceDiffuser,一种非确定性深度学习模型,用于生成语音驱动的面部动画,其使用基于三维顶点与 blendshape 的数据集进行训练。我们的方法基于扩散(diffusion)技术,并使用预训练的大型语音表示模型 HuBERT 来编码音频输入。据我们所知,我们首次将扩散方法用于语音驱动三维面部动画合成任务。我们进行了广泛的客观与主观分析,并展示我们的方法相较最先进(SOTA)方法取得了更优或相当的结果。我们还引入了一个基于 blendshape 绑定角色的新内部数据集。我们建议观看随附的补充视频。代码与数据集将公开可用。

关键词

引用

@article{arxiv.2309.11306,
  title  = {FaceDiffuser: Speech-Driven 3D Facial Animation Synthesis Using Diffusion},
  author = {Stefan Stan and Kazi Injamamul Haque and Zerrin Yumak},
  journal= {arXiv preprint arXiv:2309.11306},
  year   = {2023}
}

备注

Pre-print of the paper accepted at ACM SIGGRAPH MIG 2023