基于注意力的转导器用于在线语音识别
音频与语音处理
2020-05-19 v1 计算与语言
声音
摘要
近期研究揭示了循环神经网络转导器(RNN-T)用于端到端(E2E)语音识别的潜力。在包括RNN-T、注意力编码器-解码器(AED)和连接主义时序分类(CTC)的一些最流行的E2E系统中,RNN-T具有明显优势,因其支持流式识别且不具有帧独立假设。尽管RNN-T研究已取得显著进展,其在训练速度与准确率方面仍面临性能挑战。我们提出基于注意力的转导器,在两方面对RNN-T进行修改。首先,在联合网络中引入分块注意力。其次,在编码器中引入自注意力。我们所提模型在训练速度与准确率上均优于RNN-T。训练方面,我们实现了超过1.7倍的加速。使用500小时LAIX非母语英语训练数据,基于注意力的转导器相较基线RNN-T带来约10.6%的WER降低。用超过10K小时的全部数据训练,我们的最终系统相较用最佳Kaldi TDNN-f方案训练的系统实现约5.5%的WER降低。在经过8位权重量化且无WER退化后,在生产服务器单CPU核上RTF与延迟分别降至0.34~0.36与268~409毫秒。
引用
@article{arxiv.2005.08497,
title = {Attention-based Transducer for Online Speech Recognition},
author = {Bin Wang and Yan Yin and Hui Lin},
journal= {arXiv preprint arXiv:2005.08497},
year = {2020}
}
备注
submitted to Interspeech 2020