中文

用于基于样例的视觉语音合成的神经人脸模型

计算机视觉与模式识别 2021-04-13 v1

摘要

利用计算机图形模型创建逼真的人脸动画仍是一项具有挑战性的任务。它通常要么通过繁琐的手工工作解决,要么通过基于动作捕捉的技术解决,而这些技术需要专用且昂贵的硬件。基于样例的动画方法通过重用真实人物的捕捉数据来规避这些问题。该数据被分割为短的运动样本,这些样本可被循环或拼接以创建新的运动序列。这种方法明显的优势是使用简便且高度真实,因为数据仅展现真实的形变。与调整复杂人脸绑定(face rig)的权重不同,动画任务在更高层次上通过安排典型运动样本以实现所需面部表演来完成。然而,基于样例的方法存在两个难点:内存需求高,以及在运动样本之间创建无伪影且逼真的过渡。我们通过将基于样例动画的真实性与简便性与神经人脸模型的优势相结合来解决这些问题。我们的神经人脸模型能够根据紧凑的潜参数向量合成高质量的 3D 人脸几何与纹理。该潜表示将内存需求降低了 100 倍,并有助于在拼接的运动样本之间创建无缝过渡。在本文中,我们提出了一种基于多视角视频的无标记人脸运动捕捉方法。基于捕捉的数据,我们学习了面部表情的神经表示,用于在动画过程中无缝拼接面部表演。我们通过基于视素(viseme)查询序列合成瑞士德语手语的口型动作,证明了我们方法的有效性。

关键词

引用

@article{arxiv.2009.10361,
  title  = {Neural Face Models for Example-Based Visual Speech Synthesis},
  author = {Wolfgang Paier and Anna Hilsmann and Peter Eisert},
  journal= {arXiv preprint arXiv:2009.10361},
  year   = {2021}
}