中文

利用生成对抗网络以音频输入生成连续帧合成人脸视频

声音 2022-07-20 v1 计算机视觉与模式识别 图形学 机器学习 音频与语音处理

摘要

本文提出一种基于音频的语音视频生成简易方法:给定一段音频,我们可生成目标人脸讲述该音频的视频。我们提出以剪切语音音频作为输入条件的生成对抗网络(GAN),并在生成器与判别器中采用卷积门控循环单元(GRU)。我们的模型通过利用短音频及该时段内的帧进行训练。训练时,我们剪切音频并提取对应帧中的人脸。我们设计了一个简易编码器,并比较了使用与未使用GRU的GAN所生成的帧。我们采用GRU以获得时间相干帧,结果表明短音频可产生较为真实的输出结果。

关键词

引用

@article{arxiv.2207.08813,
  title  = {Audio Input Generates Continuous Frames to Synthesize Facial Video Using Generative Adiversarial Networks},
  author = {Hanhaodi Zhang},
  journal= {arXiv preprint arXiv:2207.08813},
  year   = {2022}
}

备注

5 pages, 5 figures