中文

利用单通道时域增强网络改善噪声鲁棒自动语音识别

音频与语音处理 2020-03-10 v1 机器学习 声音

摘要

随着深度学习的出现,噪声鲁棒自动语音识别(ASR)的研究进展迅速。然而,单通道系统在噪声条件下的 ASR 性能仍不尽如人意。事实上,大多数单通道语音增强(SE)方法(去噪)相较于在多条件训练数据上训练的最先进 ASR 后端仅带来了有限的性能提升。近来,基于神经网络、在时域工作的 SE 方法得到了大量研究,其性能水平前所未有。然而,此类时域方法所实现的高增强性能能否转化为 ASR 性能,尚不明晰。在本文中,我们表明单通道时域去噪方法可显著改善 ASR 性能,在 CHiME-4 数据集单通道轨的真实评估数据上,相较于一个强 ASR 后端提供了超过 30% 的相对词错误率降低。这些积极结果证明单通道噪声抑制仍可改善 ASR 性能,这应为该方向更多研究打开大门。

关键词

引用

@article{arxiv.2003.03998,
  title  = {Improving noise robust automatic speech recognition with single-channel time-domain enhancement network},
  author = {Keisuke Kinoshita and Tsubasa Ochiai and Marc Delcroix and Tomohiro Nakatani},
  journal= {arXiv preprint arXiv:2003.03998},
  year   = {2020}
}

备注

5 pages, to appear in ICASSP2020