中文

EmoTalkingGaussian:连续情感条件驱动的说话头合成

计算机视觉与模式识别 2025-02-04 v1

摘要

基于 3D 高斯泼溅的说话头合成因其能够以实时推理速度渲染高保真图像而近期受到关注。然而,由于它通常仅在缺乏面部情感多样性的短视频上进行训练,因此生成的说话头难以表现广泛的情感。为了解决这个问题,我们提出了一种唇形对齐的情感面部生成器,并利用它来训练我们的 EmoTalkingGaussian 模型。该模型能够根据连续情感值(即效价和唤醒度)来操控面部情感,同时保持唇部运动与输入音频的同步。此外,为了实现针对自然场景音频的精确唇形同步,我们引入了一种自监督学习方法,该方法利用了文本到语音网络和视觉-音频同步网络。我们在公开视频上对 EmoTalkingGaussian 进行了实验,在图像质量(以 PSNR、SSIM、LPIPS 衡量)、情感表达(以 V-RMSE、A-RMSE、V-SA、A-SA、情感准确度衡量)和唇形同步(以 LMD、Sync-E、Sync-C 衡量)方面,分别取得了优于现有最先进技术的结果。

关键词

引用

@article{arxiv.2502.00654,
  title  = {EmoTalkingGaussian: Continuous Emotion-conditioned Talking Head Synthesis},
  author = {Junuk Cha and Seongro Yoon and Valeriya Strizhkova and Francois Bremond and Seungryul Baek},
  journal= {arXiv preprint arXiv:2502.00654},
  year   = {2025}
}

备注

22 pages