中文

迈向单声道鲁棒 ASR 中前端增强与后端识别的解耦

声音 2024-03-12 v1 音频与语音处理

摘要

已有研究表明,语音增强(SE)算法可以提高含噪语音的可懂度。然而,与直接在含噪语音上训练的自动语音识别(ASR)模型相比,单声道 SE 尚未被确立为噪声条件下的有效前端。SE 与 ASR 之间的鸿沟阻碍了鲁棒 ASR 系统的发展,尤其是在 SE 近年来取得重大进展的情况下。本文致力于利用时域 ARN(注意力循环网络)和时频域 CrossNet 增强模型来消除这一鸿沟。所提出的系统将前端增强与仅在纯净语音上训练的后端 ASR 完全解耦。在 WSJ、CHiME-2、LibriSpeech 和 CHiME-4 语料库上的结果表明,ARN 和 CrossNet 增强后的语音均能转化为在噪声和混响环境中改善的 ASR 结果,并能很好地泛化到真实声学场景。所提出的系统优于直接在受损语音上训练的基线。此外,它将 CHiME-2 上先前的最佳词错率(WER)相对降低了 28.4%28.4\%(绝对 WER 为 5.57%5.57\%),并在未对 CHiME-4 进行训练的情况下,在单通道 CHiME-4 模拟/真实测试数据上分别实现了 3.32/4.44%3.32/4.44\% 的 WER。

关键词

引用

@article{arxiv.2403.06387,
  title  = {Towards Decoupling Frontend Enhancement and Backend Recognition in Monaural Robust ASR},
  author = {Yufeng Yang and Ashutosh Pandey and DeLiang Wang},
  journal= {arXiv preprint arXiv:2403.06387},
  year   = {2024}
}

备注

Submitted to IEEE/ACM Transactions on Audio, Speech and Language Processing. arXiv admin note: text overlap with arXiv:2210.13318