改善基于DNN的语音增强泛化能力的归一化特征
声音
2018-01-16 v2
摘要
增强含噪语音是恢复其质量并提高其可懂度的重要任务。在传统的基于非机器学习(ML)的方法中,所需的降噪参数是从含噪观测中盲估计的,而实际滤波函数是基于统计假设解析推导的。尽管此类方法对许多不同声学条件泛化良好,但在瞬态噪声中的噪声抑制能力较低。为修正此缺点,机器学习(ML)方法如深度学习已被用于语音增强。然而,由于其数据驱动性质,基于ML的方法对未知噪声类型的泛化仍被讨论。为改善ML算法的泛化并增强非ML方法的噪声抑制,我们提出两种方法的结合。为此,我们在基于深度神经网络(DNN)的增强方案中采用作为输入特征估计的先验信噪比(SNR)和后验信噪比。我们表明该方法允许基于ML的语音估计器快速泛化到未知噪声类型,即使在训练期间仅见过少量噪声条件。此外,所提特征优于一种竞争方法,该方法将噪声功率谱密度估计附加到含噪谱上。诸如语音质量感知评估(PESQ)和短时客观可懂度(STOI)的客观度量表明,当使用所提特征时,在未见条件下有显著改进。听音实验证实了我们所提组合的改进泛化。
引用
@article{arxiv.1709.02175,
title = {Normalized Features for Improving the Generalization of DNN Based Speech Enhancement},
author = {Robert Rehr and Timo Gerkmann},
journal= {arXiv preprint arXiv:1709.02175},
year = {2018}
}
备注
10 pages, 4 figures, Journal