中文

多语言序列到序列语音识别:架构、迁移学习与语言建模

计算与语言 2018-10-09 v1 机器学习 声音 音频与语音处理

摘要

用于低资源 ASR 的序列到序列(seq2seq)方法是语音研究中一个相对较新的方向。该方法通过在不使用词典和对齐的情况下进行模型训练而受益。然而,这带来了与传统 DNN-HMM 系统相比需要更多数据的新问题。在本工作中,我们尝试使用来自 10 种 BABEL 语言的数据来构建多语言 seq2seq 模型作为先验模型,然后通过迁移学习方法将其迁移到另外 4 种 BABEL 语言。我们还探索了不同的架构来改进先验多语言 seq2seq 模型。本文还讨论了在解码时将循环神经网络语言模型(RNNLM)与 seq2seq 模型集成的效果。实验结果表明,来自多语言模型的迁移学习方法在所有 4 种 BABEL 语言上相比单语模型均有实质性提升。引入 RNNLM 也在 %WER 方面带来了显著改进,并实现了与使用两倍多训练数据训练的模型相当的识别性能。

关键词

引用

@article{arxiv.1810.03459,
  title  = {Multilingual sequence-to-sequence speech recognition: architecture, transfer learning, and language modeling},
  author = {Jaejin Cho and Murali Karthick Baskar and Ruizhi Li and Matthew Wiesner and Sri Harish Mallidi and Nelson Yalta and Martin Karafiat and Shinji Watanabe and Takaaki Hori},
  journal= {arXiv preprint arXiv:1810.03459},
  year   = {2018}
}