提升端到端神经自动语音识别模型的噪声鲁棒性
音频与语音处理
2020-10-27 v1
摘要
我们展示了通过使用密集数据增强训练对噪声鲁棒的端到端自动语音识别(ASR)模型的实验。我们探索了微调预训练模型以提升噪声鲁棒性的功效,发现这是针对各种噪声条件进行训练的一种非常高效的方式,尤其在模型将使用的条件未知时。从在干净数据上训练的模型出发有助于建立干净语音上的基线性能。我们仔细微调该模型,以既保持干净语音上的性能,又提升噪声条件下的模型准确率。借助此方案,我们在大型公开语料库上训练了对噪声鲁棒的英文和中文 ASR 模型。所有描述的模型与训练方案均在对话式 AI 工具包 NeMo 中开源。
引用
@article{arxiv.2010.12715,
title = {Improving Noise Robustness of an End-to-End Neural Model for Automatic Speech Recognition},
author = {Jagadeesh Balam and Jocelyn Huang and Vitaly Lavrukhin and Slyne Deng and Somshubra Majumdar and Boris Ginsburg},
journal= {arXiv preprint arXiv:2010.12715},
year = {2020}
}