在高度混响的真实环境中探索特征与增强对语音识别系统的鲁棒性
音频与语音处理
2018-03-28 v1 声音
摘要
本文使用 HRRE 数据库评估了基于 DNN-HMM 的语音识别系统在高度混响的真实环境中的鲁棒性。讨论并评估了局部归一化滤波器组 (LNFB) 和 Mel 滤波器组 特征结合非负矩阵分解 (NMF)、慢变分量抑制与下降沿 (SSF) 以及加权预测误差 (WPE) 增强方法的性能。考虑了两种训练条件:干净和混响。在 Reverb 训练下,使用 WPE 和 LNFB 提供的 WER 平均比 SSF 和 NMF 分别低 3% 和 20%。WPE 和 MelFB 提供的 WER 平均比 SSF 和 NMF 分别低 11% 和 24%。在代表测试与训练条件之间存在显著不匹配的干净训练下,LNFB 特征明显优于 MelFB 特征。结果表明,不同类型的训练、参数化和增强技术可能更适合特定的说话人-麦克风距离和混响时间的组合。这表明,使用不同增强和参数化方法训练的系统之间可能存在某种程度的互补性。
引用
@article{arxiv.1803.09013,
title = {Exploring the robustness of features and enhancement on speech recognition systems in highly-reverberant real environments},
author = {José Novoa and Juan Pablo Escudero and Jorge Wuth and Victor Poblete and Simon King and Richard Stern and Néstor Becerra Yoma},
journal= {arXiv preprint arXiv:1803.09013},
year = {2018}
}
备注
5 pages