中文

用于极低资源自动语音识别的生成对抗训练数据适配

音频与语音处理 2020-08-03 v2 计算与语言

摘要

转录并归档濒危语言的语音数据对于保护口头文化遗产十分重要,而自动语音识别(ASR)是促进此过程的强大工具。然而,由于濒危语言通常没有含众多说话人的大型语料库,在其上训练的 ASR 模型性能普遍相当差。尽管如此,我们常遗留大量需转录的自发语音录音。本工作中,为缓解此说话人稀疏问题,我们提出转换整个训练语音数据并使其听起来像测试说话人,从而为该说话人开发高精度 ASR 系统。为此,我们利用基于 CycleGAN 的非并行语音转换技术伪造接近测试说话人语音的带标注训练数据。我们在两个低资源语料库(即 Ainu 和 Mboshi)上评估了该说话人适配方法。在 Ainu 语料上我们获得了 35-60% 的音素错误率相对提升,在 Mboshi 语料上取得了 40% 的相对提升。该方法在这两个语料上均优于无监督适配与多语言训练两种常规方法。

关键词

引用

@article{arxiv.2005.09256,
  title  = {Generative Adversarial Training Data Adaptation for Very Low-resource Automatic Speech Recognition},
  author = {Kohei Matsuura and Masato Mimura and Shinsuke Sakai and Tatsuya Kawahara},
  journal= {arXiv preprint arXiv:2005.09256},
  year   = {2020}
}

备注

Accepted for Interspeech 2020