中文

语言通用音素编码器用于低资源语音识别

音频与语音处理 2023-05-22 v1 计算与语言 声音

摘要

多语言训练可有效改善低资源 ASR,其部分原因可能是语言间的音素表示共享。在端到端(E2E)ASR 系统中,字素常被用作基本建模单元,然而字素可能并不理想于多语言音素共享。本文中,我们首次在注意力编码器-解码器架构内利用基于国际音标(IPA)的语言通用音素模型来改善低资源 ASR 性能。我们提出一种针对音素 IPA 模型的适配方法,以在极低资源语言上进一步改进所提方法。在开源 MLS 语料库和我们内部数据库上进行的实验表明,我们的方法优于基线单语模型及大多数最先进工作。我们的主要方法与适配在极低资源语言上均有效,即使在域与语言不匹配的场景下也是如此。

关键词

引用

@article{arxiv.2305.11576,
  title  = {Language-universal phonetic encoder for low-resource speech recognition},
  author = {Siyuan Feng and Ming Tu and Rui Xia and Chuanzeng Huang and Yuxuan Wang},
  journal= {arXiv preprint arXiv:2305.11576},
  year   = {2023}
}

备注

Accepted for publication in INTERSPEECH 2023