中文

探索RNN-Transducer用于中文语音识别

计算与语言 2019-04-24 v2 机器学习 声音 音频与语音处理

摘要

端到端方法因显著简化自动语音识别(ASR)系统的构建而近期备受关注。RNN transducer(RNN-T)是流行的端到端方法之一。先前研究表明RNN-T难以训练,且需要非常复杂的训练过程才能获得合理性能。本文中,我们探索将RNN-T用于中文大词汇量连续语音识别(LVCSR)任务,旨在简化训练过程同时保持性能。首先,提出一种新的学习率衰减策略以加速模型收敛。其次,我们发现于网络起始处添加卷积层并使用有序数据,可在不损失性能的前提下省去编码器的预训练过程。此外,我们设计实验以在GPU内存使用、训练周期与模型性能之间找到平衡。最终,我们在测试集上取得16.9%的字错误率(CER),相较在同一文本语料上训练带语言模型的强BLSTM CE系统绝对提升2%。

关键词

引用

@article{arxiv.1811.05097,
  title  = {Exploring RNN-Transducer for Chinese Speech Recognition},
  author = {Senmao Wang and Pan Zhou and Wei Chen and Jia Jia and Lei Xie},
  journal= {arXiv preprint arXiv:1811.05097},
  year   = {2019}
}