中文

EmoTalker:基于扩散模型的情感可编辑说话人脸生成

计算机视觉与模式识别 2024-01-17 v1 声音 音频与语音处理

摘要

近年来,说话人脸生成领域引起了广泛关注,某些方法擅长生成能够令人信服地模仿人类表情的虚拟人脸。然而,现有方法面临泛化能力有限的挑战,特别是在处理具有挑战性的身份时。此外,表情编辑方法通常局限于单一情感,无法适应复杂的情感。为了克服这些挑战,本文提出了 EmoTalker,一种基于扩散模型的情感可编辑肖像动画方法。EmoTalker 修改了去噪过程,以确保在推理过程中保留原始肖像的身份。为了增强从文本输入中对情感的理解,我们引入了情感强度块 (Emotion Intensity Block) 来分析提示词中 derived 的细粒度情感和强度。此外,我们还利用一个精心构建的数据集来增强提示词中的情感理解。实验表明,EmoTalker 在生成高质量、情感可定制的面部表情方面具有有效性。

关键词

引用

@article{arxiv.2401.08049,
  title  = {EmoTalker: Emotionally Editable Talking Face Generation via Diffusion Model},
  author = {Bingyuan Zhang and Xulong Zhang and Ning Cheng and Jun Yu and Jing Xiao and Jianzong Wang},
  journal= {arXiv preprint arXiv:2401.08049},
  year   = {2024}
}

备注

Accepted by 2024 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP2024)