中文

GLDiTalker:基于图潜在扩散Transformer的语音驱动3D面部动画

计算机视觉与模式识别 2025-12-08 v5

摘要

语音驱动的说话人生成是一项具有增强现实和虚拟人类建模等应用价值的关键且具有挑战性的任务。虽然最近的自回归和扩散模型方法取得了显著进展,但常常存在模态不一致问题,尤其是音频与网格之间的错位,导致运动多样性和唇语同步 accuracy 降低。为此,我们提出GLDiTalker,一种基于图潜在扩散Transformer的语音驱动3D面部动画模型。GLDiTalker通过在量化时空潜在空间内扩散信号来解决模态错位问题。它采用两阶段训练流程:图增强量化空间学习阶段确保唇语同步,时空驱动潜在扩散阶段提高运动多样性。通过这两个阶段,GLDiTalker能够生成逼真且时序稳定的3D面部动画。广泛的基准测试表明,GLDiTalker优于现有方法,在唇语同步和运动多样性方面均取得优异成绩。

关键词

引用

@article{arxiv.2408.01826,
  title  = {GLDiTalker: Speech-Driven 3D Facial Animation with Graph Latent Diffusion Transformer},
  author = {Yihong Lin and Zhaoxin Fan and Xianjia Wu and Lingyu Xiong and Liang Peng and Xiandong Li and Wenxiong Kang and Songju Lei and Huang Xu},
  journal= {arXiv preprint arXiv:2408.01826},
  year   = {2025}
}

备注

9 pages, 5 figures