改进RNN Transducer建模用于端到端语音识别
计算与语言
2019-09-30 v1 音频与语音处理
摘要
过去几年,自动语音识别研究的一个新兴趋势是端到端(E2E)系统的研究。Connectionist Temporal Classification (CTC)、Attention Encoder-Decoder (AED)和RNN Transducer (RNN-T)是最流行的三种方法。在这三种方法中,RNN-T具有进行在线流式的优势(这对AED具有挑战性),且不具有CTC的帧独立假设。本文中,我们从两方面改进RNN-T训练。首先,我们优化RNN-T的训练算法以减少内存消耗,从而可使用更大的训练小批量以加快训练速度。其次,我们提出更好的模型结构,以获得精度优良且占用小的RNN-T模型。使用三万小时匿名且转写的微软生产数据训练,最佳RNN-T模型即便模型更小(216兆字节)也实现了相较基线RNN-T模型最高11.8%的相对词错误率(WER)降低。该最佳RNN-T模型显著优于尺寸相近的设备混合模型,实现最高15.0%的相对WER降低,并取得与大小为5120兆字节的服务器混合模型相似的WER。
引用
@article{arxiv.1909.12415,
title = {Improving RNN Transducer Modeling for End-to-End Speech Recognition},
author = {Jinyu Li and Rui Zhao and Hu Hu and Yifan Gong},
journal= {arXiv preprint arXiv:1909.12415},
year = {2019}
}
备注
Accepted by IEEE ASRU workshop, 2019