中文

用于语音增强与噪声鲁棒说话人验证的条件生成对抗网络

音频与语音处理 2019-11-05 v2 机器学习 声音 信号处理 机器学习

摘要

在噪声环境中改善语音系统性能仍是一项挑战,语音增强(SE)是解决该问题的有效技术之一。受生成对抗网络(GANs)在多种图像处理任务中前景广阔的结果启发,我们探索条件GANs(cGANs)用于SE的潜力,特别地,我们利用Isola等人[1]提出的图像处理框架来学习从噪声语音谱图到增强对应物的映射。SE cGAN由两个网络以对抗方式训练:生成器试图增强输入噪声谱图,判别器试图利用噪声谱图作为条件,区分生成器提供的增强谱图与数据库中的干净谱图。我们从语音质量感知评估(PESQ)、短时客观可懂度(STOI)和说话人验证的等错误率(EER)(一个应用示例)方面评估cGAN方法的性能。实验结果表明,cGAN方法总体优于经典的短时谱幅度最小均方误差(STSA-MMSE)SE算法,并与基于深度神经网络(DNN-SE)的SE方法相当。

关键词

引用

@article{arxiv.1709.01703,
  title  = {Conditional Generative Adversarial Networks for Speech Enhancement and Noise-Robust Speaker Verification},
  author = {Daniel Michelsanti and Zheng-Hua Tan},
  journal= {arXiv preprint arXiv:1709.01703},
  year   = {2019}
}

备注

INTERSPEECH 2017 August 20-24, 2017, Stockholm, Sweden