中文

Audio2Face:基于注意力双向LSTM网络从单音频生成语音/面部动画

机器学习 2019-05-28 v1 计算机视觉与模式识别 声音 音频与语音处理 图像与视频处理

摘要

我们提出了一种端到端的深度学习方法,用于仅从音频生成实时面部动画。具体而言,我们的深度架构采用深度双向长短期记忆网络(long short-term memory, LSTM)与注意力机制,以发现语音中时变上下文信息的潜在表示,并识别不同信息对特定面部状态贡献的重要性。因此,我们的模型在推理时能够驱动不同层级的面部运动,并自动与输入音频中对应的音高和潜在说话风格保持同步,无需任何假设或进一步的人为干预。评估结果表明,我们的方法不仅能从音频生成准确的唇部运动,还能成功回归说话者时变的面部运动。

关键词

引用

@article{arxiv.1905.11142,
  title  = {Audio2Face: Generating Speech/Face Animation from Single Audio with Attention-Based Bidirectional LSTM Networks},
  author = {Guanzhong Tian and Yi Yuan and Yong liu},
  journal= {arXiv preprint arXiv:1905.11142},
  year   = {2019}
}