中文

开发超越高性能混合模型且具有定制能力的 RNN-T 模型

音频与语音处理 2020-07-31 v1 计算与语言 声音

摘要

由于其流式特性,循环神经网络转导器(RNN-T)是一种非常有前景的端到端(E2E)模型,有望取代广泛使用的混合模型用于自动语音识别。本文描述了我们近期开发的 RNN-T 模型,其降低了训练时的 GPU 内存消耗,采用了更好的初始化策略,并引入了带未来前瞻的先进编码器建模。当使用微软 6.5 万小时匿名训练数据训练时,所开发的 RNN-T 模型在识别准确率和更低延迟上均超越了一个训练良好的混合模型。我们进一步研究如何将 RNN-T 模型定制到新领域,这对将 E2E 模型部署到实际场景十分重要。通过比较几种利用新领域纯文本数据的方法,我们发现使用由领域特定文本生成的语音合成(TTS)来更新 RNN-T 的预测与联合网络最为有效。

关键词

引用

@article{arxiv.2007.15188,
  title  = {Developing RNN-T Models Surpassing High-Performance Hybrid Models with Customization Capability},
  author = {Jinyu Li and Rui Zhao and Zhong Meng and Yanqing Liu and Wenning Wei and Sarangarajan Parthasarathy and Vadim Mazalov and Zhenghao Wang and Lei He and Sheng Zhao and Yifan Gong},
  journal= {arXiv preprint arXiv:2007.15188},
  year   = {2020}
}

备注

Accepted by Interspeech 2020