中文

流式端到端语音识别系统的迁移学习方法

音频与语音处理 2020-08-18 v2 计算与语言 机器学习 声音

摘要

迁移学习(TL)在传统混合自动语音识别(ASR)系统中被广泛用于从源语言向目标语言迁移知识。TL 可应用于端到端(E2E)ASR 系统(如循环神经网络转导器(RNN-T)模型),方法是以源语言预训练模型初始化目标语言的编码器及/或预测网络。在混合 ASR 系统中,迁移学习通常通过以源语言声学模型(AM)初始化目标语言 AM 来实现。在 RNN-T 框架下,根据编码器与预测网络初始化模型的选择,存在多种迁移学习策略。本文对 RNN-T 框架下的四种不同 TL 方法进行比较研究。我们展示了不同 TL 方法相较随机初始化 RNN-T 模型可实现 17% 的相对词错误率降低。我们还研究了 TL 在 50 至 1000 小时不同训练数据量下的影响,并展示了 TL 对训练数据量较少语言的有效性。

关键词

引用

@article{arxiv.2008.05086,
  title  = {Transfer Learning Approaches for Streaming End-to-End Speech Recognition System},
  author = {Vikas Joshi and Rui Zhao and Rupesh R. Mehta and Kshitiz Kumar and Jinyu Li},
  journal= {arXiv preprint arXiv:2008.05086},
  year   = {2020}
}