中文

情感内容解耦的基于语音的3D说话人面部动画——EmoFace

计算机视觉与模式识别 2025-05-19 v3

摘要

3D说话人面部动画的制作正在变得越来越富有表现力。目前,大多数基于语音的工作集中注意力于唇部同步,而忽略了有效捕捉情感与面部动作之间的相关性。为此,我们提出一种两种流网络结构的EmoFace,包含情感分支和内容分支。EmoFace采用新颖的网格注意力机制来分析和融合情感特征和内容特征。特别地,在网格注意力中引入了新设计的基于网格顶点时空依赖性的卷积,SpiralConv3D,用于学习潜在的时空特征依赖。此外, 我们在3D人脸动画任务中首次引入一种新的自增长训练方案,配合中间监督,以动态调整3D人脸动画任务中采用的真实值比例。综合的定量和定性评估在我们高质量的3D情感面部动画数据集(3D-RAVDESS, LVE 为 4.8863×1054.8863\times 10^{-5}mm, EVE 为 0.9509×1050.9509\times 10^{-5}mm)以及公共数据集VOCASET (LVE 为 2.8669×1052.8669\times 10^{-5}mm, EVE 为 0.4664×1050.4664\times 10^{-5}mm)上表明,我们的方法实现了最先进的性能。

关键词

引用

@article{arxiv.2408.11518,
  title  = {EmoFace: Emotion-Content Disentangled Speech-Driven 3D Talking Face Animation},
  author = {Yihong Lin and Liang Peng and Zhaoxin Fan and Xianjia Wu and Jianqiao Hu and Xiandong Li and Wenxiong Kang and Songju Lei},
  journal= {arXiv preprint arXiv:2408.11518},
  year   = {2025}
}