使用 MoG 模型与神经网络音素分类器的语音增强混合方法
声音
2015-10-27 v1
摘要
在本文中,我们提出了一种单麦克风语音增强算法。我们提出了一种混合方法,融合了生成式高斯混合模型和判别式神经网络。所提出的算法分两个阶段执行:不重复的训练阶段和测试阶段。首先,将无噪声语音功率谱密度建模为 MoG,以表示语音信号中基于音素的多样性。然后,使用带有音素标签的数据库训练 NN 进行音素分类,以 mel 频率倒谱系数作为输入特征。给定音素分类结果,利用生成式和判别式模型获得语音存在概率。随后执行软谱减法,同时更新噪声估计。判别式 NN 保持语音的连续性,而生成式基于音素的 MoG 保留语音的谱结构。我们提供了使用真实语音和噪声信号的广泛实验研究。我们还将所提出的算法与其他语音增强算法进行了比较。结果表明,在语音质量测度和语音识别结果方面,我们比以往方法获得了显著改善。
引用
@article{arxiv.1510.07315,
title = {A Hybrid Approach for Speech Enhancement Using MoG Model and Neural Network Phoneme Classifier},
author = {Shlomo E. Chazan and Jacob Goldberger and Sharon Gannot},
journal= {arXiv preprint arXiv:1510.07315},
year = {2015}
}