情感内容解耦的基于语音的3D说话人面部动画——EmoFace
计算机视觉与模式识别
2025-05-19 v3
摘要
3D说话人面部动画的制作正在变得越来越富有表现力。目前,大多数基于语音的工作集中注意力于唇部同步,而忽略了有效捕捉情感与面部动作之间的相关性。为此,我们提出一种两种流网络结构的EmoFace,包含情感分支和内容分支。EmoFace采用新颖的网格注意力机制来分析和融合情感特征和内容特征。特别地,在网格注意力中引入了新设计的基于网格顶点时空依赖性的卷积,SpiralConv3D,用于学习潜在的时空特征依赖。此外, 我们在3D人脸动画任务中首次引入一种新的自增长训练方案,配合中间监督,以动态调整3D人脸动画任务中采用的真实值比例。综合的定量和定性评估在我们高质量的3D情感面部动画数据集(3D-RAVDESS, LVE 为 mm, EVE 为 mm)以及公共数据集VOCASET (LVE 为 mm, EVE 为 mm)上表明,我们的方法实现了最先进的性能。
引用
@article{arxiv.2408.11518,
title = {EmoFace: Emotion-Content Disentangled Speech-Driven 3D Talking Face Animation},
author = {Yihong Lin and Liang Peng and Zhaoxin Fan and Xianjia Wu and Jianqiao Hu and Xiandong Li and Wenxiong Kang and Songju Lei},
journal= {arXiv preprint arXiv:2408.11518},
year = {2025}
}