Audio2Face:基于注意力双向LSTM网络从单音频生成语音/面部动画
机器学习
2019-05-28 v1 计算机视觉与模式识别
声音
音频与语音处理
图像与视频处理
摘要
我们提出了一种端到端的深度学习方法,用于仅从音频生成实时面部动画。具体而言,我们的深度架构采用深度双向长短期记忆网络(long short-term memory, LSTM)与注意力机制,以发现语音中时变上下文信息的潜在表示,并识别不同信息对特定面部状态贡献的重要性。因此,我们的模型在推理时能够驱动不同层级的面部运动,并自动与输入音频中对应的音高和潜在说话风格保持同步,无需任何假设或进一步的人为干预。评估结果表明,我们的方法不仅能从音频生成准确的唇部运动,还能成功回归说话者时变的面部运动。
引用
@article{arxiv.1905.11142,
title = {Audio2Face: Generating Speech/Face Animation from Single Audio with Attention-Based Bidirectional LSTM Networks},
author = {Guanzhong Tian and Yi Yuan and Yong liu},
journal= {arXiv preprint arXiv:1905.11142},
year = {2019}
}