中文

用于鲁棒自动语音识别的时域语音增强

音频与语音处理 2023-06-22 v3 声音

摘要

已有研究表明,语音增强算法可改善含噪语音的可懂度。然而,与直接在含噪语音上训练的 ASR 模型相比,语音增强尚未成为噪声条件下鲁棒自动语音识别(ASR)的有效前端。语音增强与 ASR 之间的隔阂阻碍了鲁棒 ASR 系统的进展,尤其是近年来语音增强已取得重大进展。在这项工作中,我们专注于使用基于 ARN(注意力循环网络)的时域增强模型来消除这一隔阂。所提出的系统完全解耦了语音增强与仅在干净语音上训练的声学模型。在 CHiME-2 语料库上的结果表明,ARN 增强的语音转化为改进的 ASR 结果。所提出的系统实现了 6.28%6.28\% 的平均词错误率,相对优于先前最佳方法 19.3%19.3\%

关键词

引用

@article{arxiv.2210.13318,
  title  = {Time-Domain Speech Enhancement for Robust Automatic Speech Recognition},
  author = {Yufeng Yang and Ashutosh Pandey and DeLiang Wang},
  journal= {arXiv preprint arXiv:2210.13318},
  year   = {2023}
}

备注

Accepted by Interspeech 2023, 5 pages, 2 figures