中文

LumièreNet:从音频合成讲座视频

机器学习 2019-07-05 v1 计算机视觉与模式识别 音频与语音处理 机器学习

摘要

我们提出LumièreNet,一种简单、模块化且完全基于深度学习的架构,可从任意长度的教师新音频旁白合成高质量、全姿态的头像讲座视频。与先前工作不同,LumièreNet完全由可训练的神经网络模块组成,通过(中间的)基于姿态估计的紧凑抽象隐码,从音频到视频学习映射函数。我们的视频演示可在[22]和[23]处获取。

关键词

引用

@article{arxiv.1907.02253,
  title  = {Lumi\`ereNet: Lecture Video Synthesis from Audio},
  author = {Byung-Hak Kim and Varun Ganapathi},
  journal= {arXiv preprint arXiv:1907.02253},
  year   = {2019}
}