中文

DiffusionTalker:基于 Personalizer-Guided Distillation 的高效紧凑语音驱动3D说话人头

计算机视觉与模式识别 2025-03-25 v1 人工智能 声音

摘要

实时语音驱动3D人脸动画一直是学术界和工业界的热门话题。传统方法主要致力于从语音学习确定性映射。近期方法开始考虑语音驱动3D人脸动画的非确定性事实,并采用扩散模型。现有基于扩散的方法可以提高人脸动画的多样性,但个人化的发言风格以准确的唇语为缺失,同时效率和紧凑性仍有待提高。本文提出了通过 personalizer-guided distillation 来解决上述问题。关于个人化,我们引入对比型 personalizer 来学习身份和情感嵌入,以捕获语音中的发言风格。我们进一步提出了在蒸馏期间的 personalizer enhancer 来增强嵌入对人脸动画的影响。就效率而言,我们使用迭代蒸馏减少动画生成所需的步骤数,实现了超过8倍的推理加速。为实现紧凑性,我们将大型教师模型蒸馏到更小的学生模型,减少模型存储量86.4%,同时最小化性能损失。在蒸馏后,用户可以从音频中推导出自己的身份和情感嵌入,以快速创建反映特定发言风格的个人化动画。开展了大量实验以证明我们的方法在性能上优于当前最先进的方法。代码将在 https://github.com/ChenVoid/DiffusionTalker 发布。

关键词

引用

@article{arxiv.2503.18159,
  title  = {DiffusionTalker: Efficient and Compact Speech-Driven 3D Talking Head via Personalizer-Guided Distillation},
  author = {Peng Chen and Xiaobao Wei and Ming Lu and Hui Chen and Feng Tian},
  journal= {arXiv preprint arXiv:2503.18159},
  year   = {2025}
}

备注

Accepted by ICME2025