中文

用于改进语码转换语音 ASR 的声学与文本数据增强

计算与语言 2018-07-31 v1

摘要

在本文中,我们描述了若干用于改进处理语码转换(CS)语音的自动语音识别(ASR)系统声学模型和语言模型的技术。我们聚焦于弗里斯兰语-荷兰语广播语音的识别,其中混合语言之一即弗里斯兰语是一种资源匮乏的语言。在先前工作中,我们已提出若干用于 CS 语音的自动转写策略以增加可用训练语音数据量。在本工作中,我们探究声学建模(AM)如何从高资源混合语言的单语语音数据中获益。为此,我们在显著增加的 CS 语音和单语荷兰语语音数据上训练了此前因缺乏训练数据而无效的先进 AM。此外,我们通过以下方式创建实践中几乎不存在的语码转换文本来改进语言模型(LM):(1) 使用在训练 CS 语音数据转写上训练的循环 LM 生成文本,(2) 添加自动转写的 CS 语音数据的转写,以及 (3) 翻译从大型荷兰语语音语料库转写中提取的荷兰语文本。我们报告了由于声学与文本训练数据增加而显著改进的 CS ASR 性能。

关键词

引用

@article{arxiv.1807.10945,
  title  = {Acoustic and Textual Data Augmentation for Improved ASR of Code-Switching Speech},
  author = {Emre Yılmaz and Henk van den Heuvel and David A. van Leeuwen},
  journal= {arXiv preprint arXiv:1807.10945},
  year   = {2018}
}

备注

Accepted for publication at Interspeech 2018