利用基于语素的语言模型解码器改进维吾尔语 ASR 系统
计算与语言
2020-03-05 v2 声音
音频与语音处理
摘要
维吾尔语是一种少数民族语言,其用于自动语音识别(ASR)研究的资源一直不足。THUYG-20 是目前唯一开源的维吾尔语语音数据集。其干净无噪语音测试任务的最优结果自首次发布以来未曾更新,显示出主流语言与维吾尔语在 ASR 发展上的巨大差距。在本文中,我们试图通过最终优化 ASR 系统,并开发一种长期缺失的基于语素的解码器 MLDG-Decoder(用于维吾尔语 DNN-HMM 系统的语素格动态生成解码器)来弥合这一差距。我们已开源该解码器。MLDG-Decoder 采用一种名为“on-the-fly composition with FEBABOS”的算法,使回退状态和转移在即时组合中起到中继站的作用。当使用基于 4-Gram 语素的语言模型(LM)时,该算法使动态生成的图能像静态全组合图一样有效地约束格中的语素序列。我们训练了更深更宽的神经网络声学模型,并试验了三种解码方案。实验结果表明,基于静态全组合图的解码将 THUYG-20 干净无噪语音测试任务上的最优词错误率(WER)降至 14.24%。MLDG-Decoder 在保持内存消耗合理的同时将 WER 降至 14.54%。基于开源的 MLDG-Decoder,读者可轻松复现本文中的实验结果。
引用
@article{arxiv.2003.01509,
title = {Improving Uyghur ASR systems with decoders using morpheme-based language models},
author = {Zicheng Qiu and Wei Jiang and Turghunjan Mamut},
journal= {arXiv preprint arXiv:2003.01509},
year = {2020}
}
备注
4 figures, 5 tables