中文

Transformer Transducer 用于普通话语音识别的建模单元研究

音频与语音处理 2020-04-29 v1 计算与语言 机器学习 声音

摘要

建模单元与模型架构是端到端语音识别中循环神经网络转导器(RNN-T)的两个关键因素。为提升 RNN-T 在普通话语音识别任务上的性能,提出了一种结合自注意力 transformer 与 RNN 架构的新型 transformer transducer。进而探讨了 transformer transducer 不同建模单元的选择。此外,我们提出了一种新的混合带宽训练方法,以获得能够同时准确识别不同采样率普通话语音的通用模型。我们所有实验均在约 12000 小时、采样率为 8kHz 和 16kHz 的普通话语音上进行。实验结果表明,采用带声调音节的普通话 transformer transducer 取得了最佳性能。与采用带声调的声母/韵母和汉字的模型相比,其词错误率(WER)分别平均相对降低 14.4% 和 44.1%。同时,相较基于带声调声母/韵母的模型,其字符错误率(CER)平均相对降低 13.5%。

关键词

引用

@article{arxiv.2004.13522,
  title  = {Research on Modeling Units of Transformer Transducer for Mandarin Speech Recognition},
  author = {Li Fu and Xiaoxiao Li and Libo Zi},
  journal= {arXiv preprint arXiv:2004.13522},
  year   = {2020}
}

备注

5 pages, 3 figures