EmoTalker:基于扩散模型的情感可编辑说话人脸生成
计算机视觉与模式识别
2024-01-17 v1 声音
音频与语音处理
摘要
近年来,说话人脸生成领域引起了广泛关注,某些方法擅长生成能够令人信服地模仿人类表情的虚拟人脸。然而,现有方法面临泛化能力有限的挑战,特别是在处理具有挑战性的身份时。此外,表情编辑方法通常局限于单一情感,无法适应复杂的情感。为了克服这些挑战,本文提出了 EmoTalker,一种基于扩散模型的情感可编辑肖像动画方法。EmoTalker 修改了去噪过程,以确保在推理过程中保留原始肖像的身份。为了增强从文本输入中对情感的理解,我们引入了情感强度块 (Emotion Intensity Block) 来分析提示词中 derived 的细粒度情感和强度。此外,我们还利用一个精心构建的数据集来增强提示词中的情感理解。实验表明,EmoTalker 在生成高质量、情感可定制的面部表情方面具有有效性。
引用
@article{arxiv.2401.08049,
title = {EmoTalker: Emotionally Editable Talking Face Generation via Diffusion Model},
author = {Bingyuan Zhang and Xulong Zhang and Ning Cheng and Jun Yu and Jing Xiao and Jianzong Wang},
journal= {arXiv preprint arXiv:2401.08049},
year = {2024}
}
备注
Accepted by 2024 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP2024)