从原始语音波形到3D面部动画的端到端学习
计算机视觉与模式识别
2017-12-11 v2
摘要
我们提出了一个深度学习框架,仅从原始波形实时进行语音驱动的3D面部动画。我们的深度神经网络将语音音频的输入序列直接映射为一系列微面部动作单元激活和头部旋转,以驱动3D blendshape 面部模型。具体而言,我们的深度模型能够学习语音中时变上下文信息和情感状态的潜在表示。因此,我们的模型不仅在推理时激活适当的面部动作单元以描绘不同的发音生成动作(以唇部运动的形式),而且无需任何假设即可自动估计说话者的情感强度,并通过调整面部单元激活的强度来再现其不断变化的情感状态。例如,在快乐的语音中,嘴部张得比平时大,而其他面部单元则放松;或者在惊讶状态下,双眉抬得更高。在不同演员跨越广泛情感状态的多样化视听语料库上的实验表明,我们的方法取得了有趣且极具前景的结果。由于与说话者无关,我们的通用模型可直接应用于人机交互和动画的各种任务。
引用
@article{arxiv.1710.00920,
title = {End-to-end Learning for 3D Facial Animation from Raw Waveforms of Speech},
author = {Hai X. Pham and Yuting Wang and Vladimir Pavlovic},
journal= {arXiv preprint arXiv:1710.00920},
year = {2017}
}