中文

用于基于序列的低资源 ASR 的音素级语言模型

计算与语言 2019-02-21 v1

摘要

构建多语言与跨语言模型有助于将不同语言带入语言通用空间。它使模型能跨语言共享参数与迁移知识,从而实现对新语言更快且更好的适配。这些方法对低资源语言尤为有用。本文提出一种可多语言使用并用于向目标语言跨语言适配的音素级语言模型。我们表明,该模型以少六倍的参数取得了近乎与单语模型相当的性能,并能在低资源场景下更好地适配训练时未见过语言。我们展示这些音素级语言模型可用于解码基于序列的 Connectionist Temporal Classification (CTC) 声学模型输出,在 Babel 语言中取得与基于 Weighted Finite State Transducer (WFST) 的解码可比较的词错率。我们还表明,在适配新语言及训练与测试数据间领域失配等多种低资源条件下,这些音素级语言模型优于 WFST 解码。

关键词

引用

@article{arxiv.1902.07613,
  title  = {Phoneme Level Language Models for Sequence Based Low Resource ASR},
  author = {Siddharth Dalmia and Xinjian Li and Alan W Black and Florian Metze},
  journal= {arXiv preprint arXiv:1902.07613},
  year   = {2019}
}

备注

To appear in ICASSP 2019