中文

扩展循环神经对齐器用于普通话流式端到端语音识别

声音 2019-02-27 v2 计算与语言 音频与语音处理

摘要

端到端模型在自动语音识别(ASR)中已展现出优越性。同时,流式识别能力已成为端到端模型日益增长的需求。顺应这些趋势,一种称为循环神经对齐器(RNA)的编码器-解码器循环神经网络近期被提出,并在两项英语 ASR 任务上展示了其竞争力。然而,尚不清楚 RNA 是否可进一步改进并应用于其他口语。在本工作中,我们探索 RNA 在汉语普通话中的适用性,并给出四种有效扩展:在编码器中,我们重新设计时间下采样并引入一种强大的卷积结构;在解码器中,我们利用正则化器平滑输出分布并与语言模型进行联合训练。在两个汉语普通话对话电话语音识别(MTS)数据集上,我们的 Extended-RNA 取得了有前景的性能。特别地,它实现了 27.7% 的字符错误率(CER),优于当前在流行的 HKUST 任务上的最优结果。

关键词

引用

@article{arxiv.1806.06342,
  title  = {Extending Recurrent Neural Aligner for Streaming End-to-End Speech Recognition in Mandarin},
  author = {Linhao Dong and Shiyu Zhou and Wei Chen and Bo Xu},
  journal= {arXiv preprint arXiv:1806.06342},
  year   = {2019}
}

备注

To appear in Interspeech 2018