中文

用于语码转换 ASR 的多图解码

计算与语言 2019-07-01 v2 声音 音频与语音处理

摘要

在 FAME! 项目中,开发了一个用于弗里斯兰语-荷兰语语音的语码转换(CS)自动语音识别(ASR)系统,能够准确转写当地广播机构的含 CS 语音的双语档案。该档案包含单语弗里斯兰语和荷兰语语音片段以及弗里斯兰-荷兰语 CS 语音,因此单语片段上的识别性能对准确转写也至关重要。在本工作中,我们提出了一种多图解码与重打分策略,将双语和单语图与统一的声学模型结合用于 CS ASR。所提出的解码方案可自由地为每个(单语或双语)识别任务设计并采用替代搜索空间,并能在低资源 CS 场景下有效利用高资源混合语言的单语资源。在我们的场景中,荷兰语为高资源语言,弗里斯兰语为低资源语言。因此我们额外使用单语荷兰语文本资源来改进荷兰语语言模型(LM),并比较了使用更大荷兰语 LM 时单图与多图 CS ASR 系统在荷兰语片段上的性能。ASR 结果表明,所提方法优于基线单图 CS ASR 系统,在单语弗里斯兰语和语码混合片段上无任何精度损失的情况下,为单语荷兰语片段提供了更好的性能。

关键词

引用

@article{arxiv.1906.07523,
  title  = {Multi-Graph Decoding for Code-Switching ASR},
  author = {Emre Yılmaz and Samuel Cohen and Xianghu Yue and David van Leeuwen and Haizhou Li},
  journal= {arXiv preprint arXiv:1906.07523},
  year   = {2019}
}

备注

Accepted for publication at Interspeech 2019