使用流式端到端模型识别长语音
音频与语音处理
2019-10-28 v1 计算与语言
声音
摘要
使用单一神经网络将音频转写为词序列的全神经端到端 (E2E) 自动语音识别 (ASR) 系统已在多项任务上取得最先进的结果。在这项工作中,我们考察了 E2E 模型泛化到未知领域的能力,发现使用短语句训练的模型无法泛化到长语音。我们提出两种互补的解决方案来解决此问题:在多样化声学数据上训练,以及在用短语句训练时通过 LSTM 状态操控来模拟长语音。在一个合成的长语音测试集上,增加数据多样性使词错误率 (WER) 相对改善了 90%,而模拟长语音训练使其相对改善了 67%,但二者结合并未比单独增加数据多样性更好。在一个真实的长语音呼叫中心测试集上,增加数据多样性使 WER 相对改善了 40%。在数据多样性基础上模拟长语音训练又使性能相对额外提升了 27%。
引用
@article{arxiv.1910.11455,
title = {Recognizing long-form speech using streaming end-to-end models},
author = {Arun Narayanan and Rohit Prabhavalkar and Chung-Cheng Chiu and David Rybach and Tara N. Sainath and Trevor Strohman},
journal= {arXiv preprint arXiv:1910.11455},
year = {2019}
}