中文

基于生成对抗学习的时间域语音增强

声音 2021-09-21 v2 机器学习 音频与语音处理

摘要

语音增强旨在从带噪语音中获取具有高可懂度和高质量的语音信号。近期工作已展示时间域深度学习方法(如 Conv-TasNet)的优异性能。然而,这些方法会因尺度不变信噪比(SI-SNR)损失所引出的波形任意尺度而性能下降。本文提出一种称为时间域语音增强生成对抗网络(TSEGAN)的新框架,其是生成对抗网络(GAN)在时间域结合度量评估的扩展,以缓解尺度问题并提供模型训练稳定性,从而实现性能提升。此外,我们提供一种基于目标函数映射的新方法,用于度量 GAN(Metric GAN)性能的理论分析,并解释其优于 Wasserstein GAN 的原因。所进行的实验证明了我们提出方法的有效性,并阐明了度量 GAN 的优势。

关键词

引用

@article{arxiv.2103.16149,
  title  = {Time-domain Speech Enhancement with Generative Adversarial Learning},
  author = {Feiyang Xiao and Jian Guan and Qiuqiang Kong and Wenwu Wang},
  journal= {arXiv preprint arXiv:2103.16149},
  year   = {2021}
}