Deep Xi 作为鲁棒自动语音识别前端
音频与语音处理
2020-01-29 v2 声音
信号处理
摘要
当前用于鲁棒自动语音识别(ASR)的前端包括基于掩蔽和映射的深度学习语音增强方法。最近提出的一种用于先验信噪比估计的深度学习方法是 DeepXi,其能够比当前基于掩蔽和映射的方法生成质量与可懂度更高的增强语音。受此启发,我们将 Deep Xi 作为鲁棒 ASR 的前端进行研究。Deep Xi 在多个信噪比水平下使用真实世界非平稳和有色噪声源进行评估。我们的实验研究表明,作为前端的 Deep Xi 能够产生比近期基于掩蔽和映射的深度学习前端更低的词错误率。本工作呈现的结果表明,Deep Xi 是一种可行的前端,并能够显著提升 ASR 系统的鲁棒性。可用性:Deep Xi 可在 https://github.com/anicolson/DeepXi 获取。
引用
@article{arxiv.1906.07319,
title = {Deep Xi as a Front-End for Robust Automatic Speech Recognition},
author = {Aaron Nicolson and Kuldip K. Paliwal},
journal= {arXiv preprint arXiv:1906.07319},
year = {2020}
}