中文

用于语码转换语音的半监督声学模型训练

计算与语言 2018-10-24 v1

摘要

在 FAME! 项目中,我们旨在开发一种用于弗里斯兰-荷兰语码转换(CS)语音的自动语音识别(ASR)系统,该语音提取自一家地方广播机构的档案,最终目标是构建口语文档检索系统。与荷兰语不同,弗里斯兰语是一种低资源语言,手动标注的语音数据极为有限。本文中,我们描述了几种自动标注方法,以在半监督设定下利用大量原始双语广播数据训练声学模型。此前已有研究表明,最佳性能的 ASR 系统是通过两阶段多语言深度神经网络(DNN)训练获得的,使用了 11 小时手动标注的 CS 语音(参考)数据以及其他高资源语言的语音数据。我们将该双语 ASR 系统提供的转写质量与另外几种方法进行比较:后者在前端使用语言识别系统为原始语音段分配语言标签,并利用单语 ASR 资源进行转写。我们进一步研究对原始广播数据中出现说话人的自动标注,首先使用说话人日志系统以(伪)说话人标签标注,随后通过说话人识别系统关联到参考数据中出现的已知说话人。这些说话人标签在所提设定下的说话人自适应训练中至关重要。我们使用手动与自动标注的数据训练声学模型,并在 FAME! 语音语料库的开发集和测试集上运行识别实验以量化自动标注的质量。ASR 与 CS 检测结果展示了在半监督双语声学模型训练中使用自动语言与说话人标注的潜力。

关键词

引用

@article{arxiv.1810.09699,
  title  = {Semi-supervised acoustic model training for speech with code-switching},
  author = {Emre Yılmaz and Mitchell McLaren and Henk van den Heuvel and David A. van Leeuwen},
  journal= {arXiv preprint arXiv:1810.09699},
  year   = {2018}
}

备注

To appear in Speech Communication - https://doi.org/10.1016/j.specom.2018.10.006