中文

KMTalk:基于关键运动嵌入的语音驱动3D面部动画

计算机视觉与模式识别 2024-09-04 v1

摘要

我们提出了一种新颖的方法,用于从音频序列合成3D面部运动,关键运动嵌入。尽管近期数据驱动技术取得了进展,但在音频信号与3D面部网格之间进行准确映射仍然具有挑战性。直接回归整个序列常常会导致结果过于平滑,由于问题的难以定义性。为此,我们提出了一种渐进式学习机制,通过引入关键运动捕捉来降低跨模态映射不确定性和学习复杂度。具体而言,我们的方法通过两个模块整合语言先验和数据驱动先验:语言基础的关键运动获取与跨模态运动完成。前者识别关键运动并学习相关的3D面部表情,确保嘴型与语音同步。后者利用音频特征将关键运动扩展为完整的3D说话面部动画序列,提高了时序一致性和音视频一致性。大量实验比较表明,我们的方法在生成更生动、更一致的说话面部动画方面优于现有最先进方法。我们提出的学习方案与现有方法集成后结果的持续提升,凸显了该方法的有效性。我们的代码和模型权重将置于项目网站:\url{https://github.com/ffxzh/KMTalk}。

关键词

引用

@article{arxiv.2409.01113,
  title  = {KMTalk: Speech-Driven 3D Facial Animation with Key Motion Embedding},
  author = {Zhihao Xu and Shengjie Gong and Jiapeng Tang and Lingyu Liang and Yining Huang and Haojie Li and Shuangping Huang},
  journal= {arXiv preprint arXiv:2409.01113},
  year   = {2024}
}

备注

Accepted by ECCV 2024