中文

利用含噪语音数据集训练语音增强系统

音频与语音处理 2021-05-27 v1 机器学习 声音

摘要

近年来,基于深度神经网络(DNN)的语音增强(SE)系统已得到极为成功的应用。在训练过程中,此类系统需要干净的语音数据——理想情况下,应大量具备多样的声学条件、许多不同的说话人特征,并针对给定采样率(例如全频带 SE 的 48kHz)。然而,获取此类干净语音数据并非易事——尤其是在仅考虑公开可用数据集的情况下。与此同时,大量具有所需声学/说话人/采样率特征的自动语音识别(ASR)素材可公开获取,但其并非干净数据,即其还包含背景噪声,因为这甚至常为获得具有噪声鲁棒性的 ASR 系统所期望。因此,利用此类数据训练 SE 系统并不简单。本文提出两项改进以在含噪语音数据上训练 SE 系统。首先,我们提出损失函数的若干修改,使其对含噪语音目标具有鲁棒性。特别地,在对时频单元求平均之前沿样本轴计算中位数,使得此类数据得以使用。此外,我们提出一种用于混合不变训练(MixIT)的噪声增强方案,使其在此类场景中亦可使用。在我们的实验中,我们使用 Mozilla Common Voice 数据集,并表明与传统方式训练的系统相比,使用我们的鲁棒损失函数使 PESQ 提升高达 0.19。类似地,对于 MixIT,使用我们提出的噪声增强时 PESQ 可提升高达 0.27。

关键词

引用

@article{arxiv.2105.12315,
  title  = {Training Speech Enhancement Systems with Noisy Speech Datasets},
  author = {Koichi Saito and Stefan Uhlich and Giorgio Fabbro and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2105.12315},
  year   = {2021}
}

备注

5 pages, 3 figures, submitted to WASPAA2021