中文

DreamTalk:当情感说话头生成遇上扩散概率模型

计算机视觉与模式识别 2024-08-13 v3

摘要

情感说话头生成受到了越来越多的关注。以往主要基于 GAN 的方法在跨不同情感持续产生令人满意的结果方面仍有困难,且无法便捷地指定个性化情感。在本工作中,我们利用强大的扩散模型来解决该问题,并提出了 DreamTalk,一个通过精心设计以释放扩散模型在生成情感说话头方面潜力的框架。具体而言,DreamTalk 由三个关键组件组成:一个去噪网络、一个风格感知唇部专家和一个风格预测器。基于扩散的去噪网络能够在不同情感下持续合成高质量的音频驱动面部动作。为了提高唇部动作的准确性和情感的饱满度,我们引入了一个风格感知唇部专家,它能够在保持情感强度的同时引导唇形同步。为了更便捷地指定个性化情感,我们利用基于扩散的风格预测器直接从音频预测个性化情感,从而无需额外的情感参考。通过这种方式,DreamTalk 能够在不同情感下持续生成生动的说话人脸,并便捷地指定个性化情感。大量实验验证了 DreamTalk 的有效性与优越性。代码可在 https://github.com/ali-vilab/dreamtalk 获取。

关键词

引用

@article{arxiv.2312.09767,
  title  = {DreamTalk: When Emotional Talking Head Generation Meets Diffusion Probabilistic Models},
  author = {Yifeng Ma and Shiwei Zhang and Jiayu Wang and Xiang Wang and Yingya Zhang and Zhidong Deng},
  journal= {arXiv preprint arXiv:2312.09767},
  year   = {2024}
}

备注

Project Page: https://dreamtalk-project.github.io