用于流式端到端语音识别的语言模型融合
计算与语言
2021-04-12 v1 机器学习
声音
音频与语音处理
摘要
许多当代实际语音识别任务需要对语音音频进行流式处理。即便如今有大型人工转写语音语料库,这类语料库也难以充分覆盖对开放式听写和语音搜索等任务至关重要的语言内容长尾。我们试图通过使用在未配对文本数据上训练的语言模型(LM)来增强端到端(E2E)模型,从而同时应对流式与长尾识别挑战。我们将浅融合与冷融合方法扩展至流式循环神经网络转导器(RNNT),并提出了两种新的具有竞争力的融合方法以进一步增强 RNNT 架构。我们在多种语言及不同训练集规模上的结果表明,这些融合方法通过引入额外语言特征改善了流式 RNNT 性能。冷融合在流式 RNNT 上一致表现更优,词错率(WER)最高改善 8.5%。
引用
@article{arxiv.2104.04487,
title = {Language model fusion for streaming end to end speech recognition},
author = {Rodrigo Cabrera and Xiaofeng Liu and Mohammadreza Ghodsi and Zebulun Matteson and Eugene Weinstein and Anjuli Kannan},
journal= {arXiv preprint arXiv:2104.04487},
year = {2021}
}
备注
5 pages