中文

论超高斯语音先验对基于机器学习的语音增强的重要性

声音 2018-01-17 v2

摘要

为了增强含噪信号,基于机器学习的单通道语音增强方案利用了关于典型语音频谱结构的先验知识。为了确保良好的泛化能力并满足计算复杂度和内存消耗方面的要求,某些方法将自身局限于学习语音频谱包络。我们将这些方法称为基于机器学习频谱包络 (MLSE) 的方法。在本文中,我们通过理论和实验分析表明,对于基于 MLSE 的方法,超高斯先验能够减少语音频谱谐波之间的噪声,而这是使用诸如 Wiener 滤波器等高斯估计器所无法实现的。在评估中,我们使用基于深度神经网络 (DNN) 的音素分类器和低秩非负矩阵分解 (NMF) 框架作为基于 MLSE 方法的示例。一项听音实验和客观测量指标证实,虽然超高斯先验对经典增强方案仅产生适度的改进,但对于基于 MLSE 的方法,超高斯先验显然发挥了重要作用,并显著优于高斯先验。

关键词

引用

@article{arxiv.1703.05003,
  title  = {On the Importance of Super-Gaussian Speech Priors for Machine-Learning Based Speech Enhancement},
  author = {Robert Rehr and Timo Gerkmann},
  journal= {arXiv preprint arXiv:1703.05003},
  year   = {2018}
}

备注

10 pages, 9 figures