中文

EmoTalk:用于 3D 人脸动画的语音驱动情感解耦

计算机视觉与模式识别 2023-08-28 v2 声音 音频与语音处理

摘要

语音驱动的 3D 人脸动画旨在生成与语音内容与情感相匹配的逼真面部表情。然而,现有方法常忽视情感面部表情,或未能将其与语音内容解耦。为解决此问题,本文提出一种端到端神经网络,以解耦语音中的不同情感,从而生成丰富的 3D 面部表情。具体而言,我们引入情感解耦编码器(EDE),通过具有不同情感标签的跨重建语音信号来解耦语音中的情感与内容。随后采用情感引导的特征融合解码器生成具有增强情感的 3D 说话人脸。该解码器由解耦的身份、情感与内容嵌入驱动,以生成可控的个人与情感风格。最后,考虑到 3D 情感说话人脸数据的稀缺性,我们借助面部 blendshape 的监督,从而能从 2D 情感数据重建合理的 3D 人脸,并贡献了一个大规模 3D 情感说话人脸数据集(3D-ETF)用于训练网络。我们的实验与用户研究表明,该方法优于当前最优方法,并展现出更多样的面部运动。建议观看补充视频:https://ziqiaopeng.github.io/emotalk

关键词

引用

@article{arxiv.2303.11089,
  title  = {EmoTalk: Speech-Driven Emotional Disentanglement for 3D Face Animation},
  author = {Ziqiao Peng and Haoyu Wu and Zhenbo Song and Hao Xu and Xiangyu Zhu and Jun He and Hongyan Liu and Zhaoxin Fan},
  journal= {arXiv preprint arXiv:2303.11089},
  year   = {2023}
}

备注

Accepted by ICCV 2023