中文

用于端到端语音识别的RNN-Transducer最小贝叶斯风险训练

计算与语言 2019-12-02 v1 机器学习 声音 音频与语音处理

摘要

在本工作中,我们提出用于端到端语音识别的RNN-Transducer(RNN-T)的最小贝叶斯风险(MBR)训练。具体而言,以训练好的RNN-T模型初始化,通过最小化参考标签序列与在线生成的N-best假设之间的期望编辑距离来进行MBR训练。我们还引入了一种启发式方法,在RNN-T束搜索解码中融入外部神经网络语言模型(NNLM),并探索使用外部NNLM进行MBR训练。实验结果表明,MBR训练的模型大幅优于RNN-T训练的模型,若使用外部NNLM训练可取得进一步提升。我们最佳的MBR训练系统在约21,000小时语音上训练出的强卷积与transformer基RNN-T基线之上,分别在朗读和自发普通话语音上实现了1.2%和0.5%的绝对字符错误率(CER)降低。

关键词

引用

@article{arxiv.1911.12487,
  title  = {Minimum Bayes Risk Training of RNN-Transducer for End-to-End Speech Recognition},
  author = {Chao Weng and Chengzhu Yu and Jia Cui and Chunlei Zhang and Dong Yu},
  journal= {arXiv preprint arXiv:1911.12487},
  year   = {2019}
}