用于英祖鲁语语码转换语音识别的半监督声学与语言模型训练
音频与语音处理
2020-04-09 v1 机器学习
声音
机器学习
摘要
我们针对使用肥皂剧语音的英祖鲁语(English-isiZulu)语码转换ASR,给出了半监督声学与语言模型训练的分析。约11小时未转写的多种语言语音,使用四个在英语-isiZulu、英语-isiXhosa、英语-Setswana和英语-Sesotho中运行的双语语码转换转写系统自动转写。这些转写被并入声学与语言模型训练集。结果表明,TDNN-F声学模型受益于额外的半监督数据,且通过加入额外的CNN层可获得更佳性能。使用这些CNN-TDNN-F声学模型,第一轮半监督训练实现了3.4%的绝对混合语言WER降低,第二轮后进一步降低2.2%。尽管未转写数据的语言未知,但当所有自动转写数据都用于训练而非仅分类为英语-isiZulu的语句时,获得了最佳结果。尽管降低了困惑度,半监督语言模型未能改善ASR性能。
引用
@article{arxiv.2004.04054,
title = {Semi-supervised acoustic and language model training for English-isiZulu code-switched speech recognition},
author = {A. Biswas and F. de Wet and E. van der Westhuizen and T. R. Niesler},
journal= {arXiv preprint arXiv:2004.04054},
year = {2020}
}
备注
4th Code-Switch workshop, France