用于语码转换 ASR 的多图解码
计算与语言
2019-07-01 v2 声音
音频与语音处理
摘要
在 FAME! 项目中,开发了一个用于弗里斯兰语-荷兰语语音的语码转换(CS)自动语音识别(ASR)系统,能够准确转写当地广播机构的含 CS 语音的双语档案。该档案包含单语弗里斯兰语和荷兰语语音片段以及弗里斯兰-荷兰语 CS 语音,因此单语片段上的识别性能对准确转写也至关重要。在本工作中,我们提出了一种多图解码与重打分策略,将双语和单语图与统一的声学模型结合用于 CS ASR。所提出的解码方案可自由地为每个(单语或双语)识别任务设计并采用替代搜索空间,并能在低资源 CS 场景下有效利用高资源混合语言的单语资源。在我们的场景中,荷兰语为高资源语言,弗里斯兰语为低资源语言。因此我们额外使用单语荷兰语文本资源来改进荷兰语语言模型(LM),并比较了使用更大荷兰语 LM 时单图与多图 CS ASR 系统在荷兰语片段上的性能。ASR 结果表明,所提方法优于基线单图 CS ASR 系统,在单语弗里斯兰语和语码混合片段上无任何精度损失的情况下,为单语荷兰语片段提供了更好的性能。
引用
@article{arxiv.1906.07523,
title = {Multi-Graph Decoding for Code-Switching ASR},
author = {Emre Yılmaz and Samuel Cohen and Xianghu Yue and David van Leeuwen and Haizhou Li},
journal= {arXiv preprint arXiv:1906.07523},
year = {2019}
}
备注
Accepted for publication at Interspeech 2019