中文

EmoDiffusion: 基于潜在扩散模型增强情感 3D 面部动画

计算机视觉与模式识别 2025-03-17 v1

摘要

语音驱动的 3D 面部动画旨在生成与语音内容及其情感细节同步的逼真面部表情,在多种多媒体领域均有应用。然而,以往的方法往往忽略面部情感表情,或未能将其与语音内容有效解耦。为应对这些挑战,我们提出了 EmoDiffusion,这是一种新方法,能够解耦语音中的不同情感以生成丰富的 3D 情感面部表情。具体而言,我们的方法采用两个变分自编码器 (VAE) 分别生成上半面部区域和嘴部区域,从而学习更精细的面部序列表示。不同于使用扩散模型连接面部表情序列与音频输入的传统方法,我们在潜在空间中执行扩散过程。此外,我们引入了 Emotion Adapter 以准确评估上半面部运动。鉴于动画行业中 3D 情感说话人脸数据的匮乏,我们在动画专家的指导下使用 iPhone 上的 LiveLinkFace 采集面部表情。这一努力促成了一项创新的 3D 混合变形情感说话人脸数据集 (3D-BEF) 的创建,用于训练我们的网络。大量实验与感知评估验证了我们方法的有效性,证实了其在生成逼真且情感丰富的面部动画方面的优越性。

关键词

引用

@article{arxiv.2503.11028,
  title  = {EmoDiffusion: Enhancing Emotional 3D Facial Animation with Latent Diffusion Models},
  author = {Yixuan Zhang and Qing Chang and Yuxi Wang and Guang Chen and Zhaoxiang Zhang and Junran Peng},
  journal= {arXiv preprint arXiv:2503.11028},
  year   = {2025}
}