中文

基于生成对抗网络的端到端视频到语音合成

机器学习 2022-08-17 v3 计算机视觉与模式识别 声音 音频与语音处理

摘要

视频到语音(video-to-speech)是从说话 utterance 的视频中重建音频语音的过程。以往处理该任务的方法依赖于两步流程:先从视频推断中间表示,再用声码器或波形重建算法将其解码为波形音频。在本工作中,我们提出了一种基于生成对抗网络(GANs)的端到端视频到语音模型,该模型将说话视频端到端地转换为波形,无需使用任何中间表示或独立的波形合成算法。我们的模型由编码器-解码器架构组成,接收原始视频作为输入并生成语音,随后将其送入波形判别器和功率判别器。基于这两个判别器的对抗损失使得直接合成原始音频波形成为可能,并保证了其真实感。此外,我们使用三种对比损失有助于建立生成音频与输入视频之间的直接对应关系。我们表明,该模型能够在 GRID 等受限数据集上以显著的真实感重建语音,并且它是首个为 LRW(Lip Reading in the Wild,野外唇读)生成可理解语音的端到端模型,LRW 包含数百名说话人完全在“野外”录制的视频。我们在两种不同场景——已见和未见说话人——下使用四个衡量人工语音质量和可理解度的客观指标对生成样本进行评估。我们证明,所提方法在 GRID 和 LRW 的大多数指标上优于以往所有工作。

关键词

引用

@article{arxiv.2104.13332,
  title  = {End-to-End Video-To-Speech Synthesis using Generative Adversarial Networks},
  author = {Rodrigo Mira and Konstantinos Vougioukas and Pingchuan Ma and Stavros Petridis and Björn W. Schuller and Maja Pantic},
  journal= {arXiv preprint arXiv:2104.13332},
  year   = {2022}
}

备注

Published in IEEE Transactions on Cybernetics (April 2022)