中文

3DiFACE:基于扩散模型的语音驱动三维面部动画与编辑

计算机视觉与模式识别 2023-12-05 v1 人工智能 图形学 机器学习

摘要

我们提出 3DiFACE,一种用于个性化语音驱动三维面部动画与编辑的新方法。现有方法从语音确定性地预测面部动画,却忽视了语音与面部表情之间固有的一对多关系,即存在多个匹配同一音频输入的合理面部表情动画。在内容创作中,能够修改生成的运动或指定关键帧尤为重要。为引入随机性以及运动编辑能力,我们提出一种轻量的音频条件扩散模型用于三维面部运动。该扩散模型可在小型三维运动数据集上训练,同时保持富有表现力的唇部运动输出。此外,它可针对特定对象进行微调,仅需该人物的一段短视频。通过定量与定性评估,我们表明该方法优于现有最先进(state-of-the-art, SOTA)技术,并生成具有更高保真度与多样性的语音驱动动画。

关键词

引用

@article{arxiv.2312.00870,
  title  = {3DiFACE: Diffusion-based Speech-driven 3D Facial Animation and Editing},
  author = {Balamurugan Thambiraja and Sadegh Aliakbarian and Darren Cosker and Justus Thies},
  journal= {arXiv preprint arXiv:2312.00870},
  year   = {2023}
}

备注

Project page: https://balamuruganthambiraja.github.io/3DiFACE/