中文

破译语音:ASR 中跨语言迁移的零资源方法

计算与语言 2022-06-07 v3 音频与语音处理

摘要

我们提出一种跨语言训练 ASR 系统的方法,该方法绝对不使用来自目标语言的任何转写训练数据,且不具备该语言的任何音系知识。我们的方法新颖地应用了一种破译算法,该算法仅给定来自目标语言的未配对语音与文本数据即可运行。我们将此破译应用于由在语言外语音语料库上训练的通用音素识别器所生成的音素序列,随后进行平启动半监督训练以获得新语言的声学模型。据我们所知,这是首个不依赖任何手工音素信息的零资源跨语言 ASR 实用方法。我们在 GlobalPhone 语料库的朗读语音上开展实验,表明仅用目标语言 20 分钟数据即可学习破译模型。当用于生成半监督训练的伪标签时,我们得到的 WER 绝对比在相同数据上训练的等效全监督模型差 32.5% 至仅 1.9%。

关键词

引用

@article{arxiv.2111.06799,
  title  = {Deciphering Speech: a Zero-Resource Approach to Cross-Lingual Transfer in ASR},
  author = {Ondrej Klejch and Electra Wallington and Peter Bell},
  journal= {arXiv preprint arXiv:2111.06799},
  year   = {2022}
}

备注

Submitted to Interspeech 2022