中文

3D-TalkEmo:学习合成三维情感说话头部

计算机视觉与模式识别 2021-04-27 v1 图形学

摘要

近年来音频驱动的三维面部动画取得了令人瞩目的进展,但合成具有丰富情感的三维说话头部仍待解决。这是由于缺乏三维生成模型及带同步音频的三维情感数据集。为此,我们提出 3D-TalkEmo,一种生成带多种情感的三维说话头部动画的深度神经网络。我们还利用精细的三维人脸重建方法,构建了一个包含同步音视频、丰富语料以及不同人物多种情感状态的大规模三维数据集。在情感生成网络中,我们提出一种新颖的三维人脸表示结构——基于经典多维尺度分析的几何图。它将三维脸上顶点坐标映射至规范图像平面,同时在最小二乘意义下保持顶点间测地距离度量。这维持了各顶点的邻接关系并保留了三维曲面的有效卷积结构。以中性三维网格与语音信号为输入,3D-TalkEmo 能够生成生动的面部动画,且支持改变动画说话人的情感状态。我们给出了方法的广泛定量与定性评估及用户研究,表明所生成说话头部质量显著优于先前最先进方法。

关键词

引用

@article{arxiv.2104.12051,
  title  = {3D-TalkEmo: Learning to Synthesize 3D Emotional Talking Head},
  author = {Qianyun Wang and Zhenfeng Fan and Shihong Xia},
  journal= {arXiv preprint arXiv:2104.12051},
  year   = {2021}
}