噪声训练改进面向边缘端的端到端语音识别
计算与语言
2021-07-13 v1
摘要
自动语音识别(ASR)在现代边缘设备上已变得日益普及。以往工作开发了可在边缘设备上紧凑运行的流式端到端(E2E)全神经网络语音识别器。然而,E2E ASR模型容易过拟合,且难以泛化到未见的测试数据。已有多种技术被提出用于正则化ASR模型的训练,包括层归一化、dropout、频谱数据增强以及输入中的速度畸变。在本工作中,我们提出一种简单而有效的噪声训练策略,以进一步改进E2E ASR模型的训练。通过在训练期间向参数空间引入随机噪声,我们的方法能在收敛时产生更平滑且泛化能力更强的模型。我们将噪声训练应用于改进稠密与稀疏的最先进Emformer模型,并观察到一致的词错率(WER)降低。具体而言,在以90%稀疏度训练Emformer时,我们在LibriSpeech Test-other和Test-clean数据集上分别实现了12%和14%的WER提升。
引用
@article{arxiv.2107.04677,
title = {Noisy Training Improves E2E ASR for the Edge},
author = {Dilin Wang and Yuan Shangguan and Haichuan Yang and Pierce Chuang and Jiatong Zhou and Meng Li and Ganesh Venkatesh and Ozlem Kalinli and Vikas Chandra},
journal= {arXiv preprint arXiv:2107.04677},
year = {2021}
}