中文

通过多语言训练、迁移学习、文本到文本映射与合成音频引导端到端 ASR 系统

音频与语音处理 2021-06-21 v2 机器学习

摘要

在有限数据资源上引导语音识别长期以来一直是活跃的研究领域。近期向全神经网络模型与端到端(E2E)训练的转变为这些已知数据饥渴的模型带来了特殊挑战,同时也带来了利用从多语言数据中导出的语言无关表示以及跨共享文字与词根语言共享的词片输出表示的机会。我们在本文中研究了在低资源条件下引导基于 RNN 转导器(RNN-T)的自动语音识别(ASR)系统的不同策略的有效性,同时利用其他语言中丰富的资源以及来自文本到语音(TTS)引擎的合成音频。我们的实验表明,来自多语言模型的迁移学习、使用 ASR 后文本到文本映射以及合成音频带来了叠加的改进,使我们能够以原本所需数据的一小部分为新语言引导模型。最佳系统相比单语基线实现了 46% 的相对词错误率(WER)降低,其中 25% 的相对 WER 提升归功于 ASR 后文本到文本映射与 TTS 合成数据。

关键词

引用

@article{arxiv.2011.12696,
  title  = {Bootstrap an end-to-end ASR system by multilingual training, transfer learning, text-to-text mapping and synthetic audio},
  author = {Manuel Giollo and Deniz Gunceler and Yulan Liu and Daniel Willett},
  journal= {arXiv preprint arXiv:2011.12696},
  year   = {2021}
}