中文

一次性音频到动画视频生成

计算机视觉与模式识别 2021-02-22 v1 声音 音频与语音处理 图像与视频处理

摘要

我们考虑音频到动画视频生成这一具有挑战性的问题。我们提出一种新方法 OneShotAu2AV,以一段音频和一张未见过的人物图像作为输入,生成任意长度的动画视频。所提方法包括两个阶段。在第一阶段,OneShotAu2AV 给定音频和人物图像,在人类域中生成说话头部视频。在第二阶段,将人类域的说话头部视频转换到动画域。第一阶段的模型架构由基于空间自适应归一化的多级生成器、多个多级判别器以及多个对抗与非对抗损失组成。第二阶段利用基于注意力的归一化驱动的 GAN 架构,以及基于时间预测器的循环损失和眨眼损失结合唇形同步损失,用于动画视频的无监督生成。在我们的方法中,输入音频片段不限于任何特定语言,这使该方法具有多语言适用性。OneShotAu2AV 可生成具有以下特征的动画视频:(a) 与音频同步的唇部运动,(b) 自然的面部表情如眨眼和眉毛运动,(c) 头部运动。实验评估表明,在包括 KID(核 inception 距离)、词错误率、每秒眨眼次数在内的多个量化指标上,OneShotAu2AV 相较于 U-GAT-IT 和 RecycleGan 具有更优性能。

关键词

引用

@article{arxiv.2102.09737,
  title  = {One Shot Audio to Animated Video Generation},
  author = {Neeraj Kumar and Srishti Goel and Ankur Narang and Brejesh Lall and Mujtaba Hasan and Pranshu Agarwal and Dipankar Sarkar},
  journal= {arXiv preprint arXiv:2102.09737},
  year   = {2021}
}

备注

arXiv admin note: substantial text overlap with arXiv:2012.07842, arXiv:2012.07304