中文

DiffusionTalker:语音驱动三维人脸扩散模型的个性化与加速

计算机视觉与模式识别 2023-12-05 v2 声音 音频与语音处理

摘要

语音驱动的三维面部动画在学术界与工业界均为一项引人关注的任务。传统方法多聚焦于学习从语音到动画的确定性映射。近期方法开始考虑语音驱动三维人脸动画的非确定性事实,并在该任务中采用扩散模型。然而,个性化面部动画与加速动画生成仍是现有基于扩散方法的兩大局限。为克服上述局限,我们提出 DiffusionTalker,一种基于扩散的方法,利用对比学习实现三维面部动画个性化,并借助知识蒸馏加速三维动画生成。具体而言,为实现个性化,我们引入可学习的说话身份以聚合音频序列中的知识。所提出的身份嵌入以对比学习方式提取不同人之间的定制化面部线索。推理时,用户可基于输入音频获得反映特定说话风格的个性化面部动画。我们将训练有数百步的扩散模型蒸馏为仅 8 步的轻量模型以实现加速。大量实验表明,我们的方法优于当前最优(state-of-the-art, SOTA)方法。代码将公开。

关键词

引用

@article{arxiv.2311.16565,
  title  = {DiffusionTalker: Personalization and Acceleration for Speech-Driven 3D Face Diffuser},
  author = {Peng Chen and Xiaobao Wei and Ming Lu and Yitong Zhu and Naiming Yao and Xingyu Xiao and Hui Chen},
  journal= {arXiv preprint arXiv:2311.16565},
  year   = {2023}
}