中文

混响环境下用于单通道鲁棒语音识别的特征组合方法

音频与语音处理 2019-06-19 v1 声音

摘要

本文探讨将互补的并行语音识别系统相组合,以降低在真实高混响环境中运行的语音识别系统的错误率。首先,测试环境由在经标定的真实房间中录制的语音组成,混响时间从 0.47 到 1.77 秒,说话人至麦克风距离从 0.16 到 2.56 米。我们在 DNN 输出层面和最终 ASR 输出层面均进行了系统组合。其次,还报道了在 reverb challenge 上的识别实验。本文给出的结果表明,在真实混响环境中录制的语音上,特征组合可带来 7% 至 18% 的 WER 改善。并且,在 DNN 输出层面的组合远比在系统输出层面的组合有效。然而,将两种方案级联仍可进一步降低 WER。

关键词

引用

@article{arxiv.1906.07299,
  title  = {On combining features for single-channel robust speech recognition in reverberant environments},
  author = {José Novoa and Josué Fredes and Jorge Wuth and Fernando Huenupán and Richard M. Stern and Nestor Becerra Yoma},
  journal= {arXiv preprint arXiv:1906.07299},
  year   = {2019}
}