LumièreNet:从音频合成讲座视频
机器学习
2019-07-05 v1 计算机视觉与模式识别
音频与语音处理
机器学习
摘要
我们提出LumièreNet,一种简单、模块化且完全基于深度学习的架构,可从任意长度的教师新音频旁白合成高质量、全姿态的头像讲座视频。与先前工作不同,LumièreNet完全由可训练的神经网络模块组成,通过(中间的)基于姿态估计的紧凑抽象隐码,从音频到视频学习映射函数。我们的视频演示可在[22]和[23]处获取。
引用
@article{arxiv.1907.02253,
title = {Lumi\`ereNet: Lecture Video Synthesis from Audio},
author = {Byung-Hak Kim and Varun Ganapathi},
journal= {arXiv preprint arXiv:1907.02253},
year = {2019}
}