中文

SE-MelGAN——说话人无关的快速语音增强

音频与语音处理 2020-06-16 v1 计算与语言 声音

摘要

语音合成领域生成对抗网络(GAN)的最新进展[3],[2]表明,可以以可靠的方式训练GAN[8],从梅尔频谱图生成高质量的相干波形。我们提出,可以将MelGAN[3]在学习语音特征方面的鲁棒性迁移到语音增强和降噪领域,而无需任何模型修改任务。我们提出的方法在多说话人语音数据集上具有良好的泛化能力,并且能够在推理过程中鲁棒地处理未见过的背景噪声。此外,我们表明,对于这种特定方法,增加批量大小不仅能产生更好的语音结果,而且能轻松泛化到多说话人数据集,并导致更快的收敛。此外,它在两个领域优于先前最先进的语音增强GAN方法SEGAN[5]:1. 质量;2. 速度。所提出的方法在GPU上的运行速度比实时快100倍以上,在CPU上比实时快2倍以上,无需任何硬件优化任务,速度与MelGAN[3]相当。

关键词

引用

@article{arxiv.2006.07637,
  title  = {SE-MelGAN -- Speaker Agnostic Rapid Speech Enhancement},
  author = {Luka Chkhetiani and Levan Bejanidze},
  journal= {arXiv preprint arXiv:2006.07637},
  year   = {2020}
}

备注

4 pages, 1 image, 1 table, 1 page for references