中文

3DiFACE:合成与编辑整体3D面部动画

图形学 2025-10-01 v1 人工智能 计算机视觉与模式识别

摘要

对于当前的语音驱动3D面部动画方法而言,创建具有精确控制和逼真头部运动的个性化3D动画仍然具有挑战性。编辑这些动画尤其复杂且耗时,需要精确控制,通常由高技能动画师处理。大多数现有工作侧重于控制合成动画的风格或情感,无法编辑/重新生成输入动画的部分内容。它们还忽略了同一音频输入可以匹配多种合理的嘴唇和头部运动这一事实。为了应对这些挑战,我们提出了3DiFACE,一种用于整体语音驱动3D面部动画的新方法。我们的方法为单一音频输入生成多样且合理的嘴唇和头部运动,并允许通过关键帧和插值进行编辑。具体来说,我们提出了一种全卷积扩散模型,该模型可以利用我们训练语料库中的视位级多样性。此外,我们采用了一种说话风格个性化方法和一种新颖的稀疏引导运动扩散,以实现精确控制和编辑。通过定量和定性评估,我们证明我们的方法能够在给定单一音频输入的情况下生成和编辑多样化的整体3D面部动画,并在高保真度和多样性之间进行控制。代码和模型可在此处获取:https://balamuruganthambiraja.github.io/3DiFACE

关键词

引用

@article{arxiv.2509.26233,
  title  = {3DiFACE: Synthesizing and Editing Holistic 3D Facial Animation},
  author = {Balamurugan Thambiraja and Malte Prinzler and Sadegh Aliakbarian and Darren Cosker and Justus Thies},
  journal= {arXiv preprint arXiv:2509.26233},
  year   = {2025}
}