中文

CodeTalker:基于离散运动先验的语音驱动三维面部动画

计算机视觉与模式识别 2023-04-04 v2

摘要

语音驱动的三维面部动画已被广泛研究,但由于高度病态本质与音视数据的稀缺,在实现真实感与生动性方面仍存在差距。现有工作通常将跨模态映射表述为回归任务,其受回归到均值问题困扰,导致过度平滑的面部运动。在本文中,我们提议将语音驱动面部动画视为在所学码本有限代理空间中的码查询任务,其通过降低跨模态映射不确定性有效提升了生成运动的生动性。该码本通过对真实面部运动自重建学习得到,从而嵌入了真实面部运动先验。在离散运动空间上,采用时间自回归模型从输入语音信号顺序合成面部运动,保证了唇形同步以及合理的面部表情。我们证明,我们的方法在定性与定量上均优于当前最先进(state-of-the-art)方法。此外,用户研究进一步佐证了我们在感知质量上的优势。

关键词

引用

@article{arxiv.2301.02379,
  title  = {CodeTalker: Speech-Driven 3D Facial Animation with Discrete Motion Prior},
  author = {Jinbo Xing and Menghan Xia and Yuechen Zhang and Xiaodong Cun and Jue Wang and Tien-Tsin Wong},
  journal= {arXiv preprint arXiv:2301.02379},
  year   = {2023}
}

备注

CVPR2023 Camera-Ready. Project Page: https://doubiiu.github.io/projects/codetalker/, Code: https://github.com/Doubiiu/CodeTalker