扩展循环神经对齐器用于普通话流式端到端语音识别
声音
2019-02-27 v2 计算与语言
音频与语音处理
摘要
端到端模型在自动语音识别(ASR)中已展现出优越性。同时,流式识别能力已成为端到端模型日益增长的需求。顺应这些趋势,一种称为循环神经对齐器(RNA)的编码器-解码器循环神经网络近期被提出,并在两项英语 ASR 任务上展示了其竞争力。然而,尚不清楚 RNA 是否可进一步改进并应用于其他口语。在本工作中,我们探索 RNA 在汉语普通话中的适用性,并给出四种有效扩展:在编码器中,我们重新设计时间下采样并引入一种强大的卷积结构;在解码器中,我们利用正则化器平滑输出分布并与语言模型进行联合训练。在两个汉语普通话对话电话语音识别(MTS)数据集上,我们的 Extended-RNA 取得了有前景的性能。特别地,它实现了 27.7% 的字符错误率(CER),优于当前在流行的 HKUST 任务上的最优结果。
引用
@article{arxiv.1806.06342,
title = {Extending Recurrent Neural Aligner for Streaming End-to-End Speech Recognition in Mandarin},
author = {Linhao Dong and Shiyu Zhou and Wei Chen and Bo Xu},
journal= {arXiv preprint arXiv:1806.06342},
year = {2019}
}
备注
To appear in Interspeech 2018