中文

Espresso:一个快速的端到端神经语音识别工具包

计算与语言 2019-10-16 v3 声音 音频与语音处理

摘要

我们提出 Espresso,一个基于深度学习库 PyTorch 和流行的神经机器翻译工具包 fairseq 的开源、模块化、可扩展的端到端神经自动语音识别(ASR)工具包。Espresso 支持跨 GPU 和计算节点的分布式训练,并具备 ASR 中常用的多种解码方法,包括前瞻基于词的语言模型融合,为此实现了一个快速的并行化解码器。在不使用数据增强的情况下,Espresso 在 WSJ、LibriSpeech 和 Switchboard 等数据集上取得了优于其他端到端系统的 SOTA ASR 性能,且解码速度比同类系统(如 ESPnet)快 4–11 倍。

关键词

引用

@article{arxiv.1909.08723,
  title  = {Espresso: A Fast End-to-end Neural Speech Recognition Toolkit},
  author = {Yiming Wang and Tongfei Chen and Hainan Xu and Shuoyang Ding and Hang Lv and Yiwen Shao and Nanyun Peng and Lei Xie and Shinji Watanabe and Sanjeev Khudanpur},
  journal= {arXiv preprint arXiv:1909.08723},
  year   = {2019}
}

备注

Accepted to ASRU 2019