面向五语言语码转换ASR的半监督声学模型训练
计算与语言
2019-10-16 v2 声音
音频与语音处理
摘要
本文介绍了南非多种语言中资源匮乏的语码转换(CS)语音声学建模的最新进展。我们考虑两种方法。第一种构建对应于语言对(英语-isiZulu、英语-isiXhosa、英语-Setswana和英语-Sesotho)的单独双语声学模型。第二种构建代表所有语言(英语、isiZulu、isiXhosa、Setswana和Sesotho)的单一统一五语言声学模型。对于这两种方法,我们考察了半监督训练在增大极稀疏声学训练集规模方面的有效性。利用约11小时未转写语音,我们表明两种方法均受益于半监督训练。双语TDNN-F声学模型还受益于CNN层(CNN-TDNN-F)的加入,而五语言系统未显示出任何显著改进。此外,由于英语在我们数据中所有语言对里均通用,在训练统一语言模型时它占主导,导致英语ASR性能提升而以其他语言为代价。尽管如此,五语言模型提供了灵活性,因为它能同时处理多于两种语言,因此作为半监督训练流程中的自动转写系统是一个有吸引力的选项。
引用
@article{arxiv.1906.08647,
title = {Semi-supervised acoustic model training for five-lingual code-switched ASR},
author = {Astik Biswas and Emre Yılmaz and Febe de Wet and Ewald van der Westhuizen and Thomas Niesler},
journal= {arXiv preprint arXiv:1906.08647},
year = {2019}
}
备注
Accepted for publication at Interspeech 2019