流式端到端设备端语音识别器的质量与稳定性分析
计算与语言
2020-08-18 v2 声音
音频与语音处理
摘要
随着自动语音识别 (ASR) 应用的普及,对快速准确的增量式语音识别的需求日益增长。增量式语音识别器在用户仍在说话时输出部分已识别词的片段。在 ASR 最终确定其假设之前,部分结果可能会被修改,从而引发不稳定问题。我们分析了设备端流式端到端 (E2E) ASR 模型的质量和稳定性。我们首先引入了一组新的指标,用于在词级别和段级别量化不稳定性。我们研究了几种模型训练技术的影响,这些技术能提升 E2E 模型质量,但会降低模型稳定性。我们对不稳定性的原因进行了分类,并探索了在流式 E2E ASR 系统中缓解这些不稳定性的各种解决方案。Index Terms: ASR, stability, end-to-end, text normalization, on-device, RNN-T
引用
@article{arxiv.2006.01416,
title = {Analyzing the Quality and Stability of a Streaming End-to-End On-Device Speech Recognizer},
author = {Yuan Shangguan and Kate Knister and Yanzhang He and Ian McGraw and Francoise Beaufays},
journal= {arXiv preprint arXiv:2006.01416},
year = {2020}
}
备注
Accepted at Interspeech 2020