迈向单声道鲁棒 ASR 中前端增强与后端识别的解耦
声音
2024-03-12 v1 音频与语音处理
摘要
已有研究表明,语音增强(SE)算法可以提高含噪语音的可懂度。然而,与直接在含噪语音上训练的自动语音识别(ASR)模型相比,单声道 SE 尚未被确立为噪声条件下的有效前端。SE 与 ASR 之间的鸿沟阻碍了鲁棒 ASR 系统的发展,尤其是在 SE 近年来取得重大进展的情况下。本文致力于利用时域 ARN(注意力循环网络)和时频域 CrossNet 增强模型来消除这一鸿沟。所提出的系统将前端增强与仅在纯净语音上训练的后端 ASR 完全解耦。在 WSJ、CHiME-2、LibriSpeech 和 CHiME-4 语料库上的结果表明,ARN 和 CrossNet 增强后的语音均能转化为在噪声和混响环境中改善的 ASR 结果,并能很好地泛化到真实声学场景。所提出的系统优于直接在受损语音上训练的基线。此外,它将 CHiME-2 上先前的最佳词错率(WER)相对降低了 (绝对 WER 为 ),并在未对 CHiME-4 进行训练的情况下,在单通道 CHiME-4 模拟/真实测试数据上分别实现了 的 WER。
引用
@article{arxiv.2403.06387,
title = {Towards Decoupling Frontend Enhancement and Backend Recognition in Monaural Robust ASR},
author = {Yufeng Yang and Ashutosh Pandey and DeLiang Wang},
journal= {arXiv preprint arXiv:2403.06387},
year = {2024}
}
备注
Submitted to IEEE/ACM Transactions on Audio, Speech and Language Processing. arXiv admin note: text overlap with arXiv:2210.13318