利用上下文音频提升 RNN-T 语音识别准确率
音频与语音处理
2021-06-16 v3 声音
摘要
我们提出了一种基于循环神经网络转导器(RNN-T)的流式自动语音识别(ASR)训练方案,该方案使编码器网络能够学习利用来自流的上下文音频,在训练期间使用流的分段或部分标注序列。我们表明,在训练和推理过程中使用上下文音频,可以在语音助手 ASR 系统的真实生产环境中使词错误率降低超过 6%。我们研究了所提训练方法对含有背景语音的声学挑战性数据的影响,并给出了表明该方法有助于网络学习说话人与环境自适应的数据点。为了进一步洞察基于长短期记忆(LSTM)的 ASR 编码器利用长期上下文的能力,我们还可视化了关于输入的 RNN-T 损失梯度。
引用
@article{arxiv.2011.10538,
title = {Improving RNN-T ASR Accuracy Using Context Audio},
author = {Andreas Schwarz and Ilya Sklyar and Simon Wiesler},
journal= {arXiv preprint arXiv:2011.10538},
year = {2021}
}