Espresso:一个快速的端到端神经语音识别工具包
计算与语言
2019-10-16 v3 声音
音频与语音处理
摘要
我们提出 Espresso,一个基于深度学习库 PyTorch 和流行的神经机器翻译工具包 fairseq 的开源、模块化、可扩展的端到端神经自动语音识别(ASR)工具包。Espresso 支持跨 GPU 和计算节点的分布式训练,并具备 ASR 中常用的多种解码方法,包括前瞻基于词的语言模型融合,为此实现了一个快速的并行化解码器。在不使用数据增强的情况下,Espresso 在 WSJ、LibriSpeech 和 Switchboard 等数据集上取得了优于其他端到端系统的 SOTA ASR 性能,且解码速度比同类系统(如 ESPnet)快 4–11 倍。
引用
@article{arxiv.1909.08723,
title = {Espresso: A Fast End-to-end Neural Speech Recognition Toolkit},
author = {Yiming Wang and Tongfei Chen and Hainan Xu and Shuoyang Ding and Hang Lv and Yiwen Shao and Nanyun Peng and Lei Xie and Shinji Watanabe and Sanjeev Khudanpur},
journal= {arXiv preprint arXiv:1909.08723},
year = {2019}
}
备注
Accepted to ASRU 2019