中文

MeshTalk:基于跨模态解耦的语音驱动三维人脸动画

计算机视觉与模式识别 2022-05-23 v2

摘要

本文提出一种从语音生成完整面部三维动画的通用方法。现有的音频驱动面部动画方法表现出诡异或静止的上半脸动画,无法产生准确合理的协同发音,或依赖于限制可扩展性的特定人物模型。为改进现有模型,我们提出一种通用音频驱动面部动画方法,可为整个面部实现高度逼真的运动合成结果。我们方法的核心是一个基于新颖跨模态损失将音频相关与音频不相关信息解耦的面部动画类别潜空间。我们的方法确保高度准确的唇部运动,同时合成与音频信号不相关的面部部位(如眨眼和眉毛运动)的逼真动画。我们证明我们的方法优于多个基线,并在定性与定量上均获得最先进(SOTA)质量。一项感知用户研究表明,在超过75%的情况下,我们的方法被认为比当前最先进技术更逼真。我们建议在阅读本文前观看补充视频:https://github.com/facebookresearch/meshtalk

关键词

引用

@article{arxiv.2104.08223,
  title  = {MeshTalk: 3D Face Animation from Speech using Cross-Modality Disentanglement},
  author = {Alexander Richard and Michael Zollhoefer and Yandong Wen and Fernando de la Torre and Yaser Sheikh},
  journal= {arXiv preprint arXiv:2104.08223},
  year   = {2022}
}

备注

updated link to github repository and supplemental video