搭建鸿沟:集成预训练语音增强与语音识别模型以实现稳健语音识别
声音
2024-06-19 v1 音频与语音处理
信号处理
摘要
在实际场景中应用自动语音识别 (ASR) 时,噪声鲁棒性至关重要。一种解决方案是将语音增强 (SE) 模型作为 ASR 的前端使用。然而,基于神经网络的 (NN-based) SE 常会引入噪声干扰并损害 ASR 性能,尤其是在 SE 和 ASR 独立训练时。因此,本研究引入一种简单而有效的 SE 后处理技术,以解决各种预训练 SE 和 ASR 模型之间的差距。提出一种轻量级 NN 作为桥接模块,用于评估语音信号的信号级信息。随后利用信号级信息应用观察添加技术有效减少 SE 的不足。实验结果表明,我们的方法成功集成了多种预训练的 SE 和 ASR 模型,显著提升了 ASR 的鲁棒性。关键的是,在训练或推理阶段无需对 ASR 或语音内容进行先验知识。此外,该方法的有效性适用于不同数据集,无需对桥接模块进行微调,确保了效率和 improved 的泛化能力。
引用
@article{arxiv.2406.12699,
title = {Bridging the Gap: Integrating Pre-trained Speech Enhancement and Recognition Models for Robust Speech Recognition},
author = {Kuan-Chen Wang and You-Jin Li and Wei-Lun Chen and Yu-Wen Chen and Yi-Ching Wang and Ping-Cheng Yeh and Chao Zhang and Yu Tsao},
journal= {arXiv preprint arXiv:2406.12699},
year = {2024}
}