中文

wav2letter++:最快的开源语音识别系统

计算与语言 2020-02-25 v1

摘要

本文介绍了 wav2letter++,最快的开源深度学习语音识别框架。wav2letter++ 完全用 C++ 编写,并使用 ArrayFire 张量库以获得最高效率。在此我们解释了 wav2letter++ 系统的架构与设计,并将其与其他主要的开源语音识别系统进行比较。在某些情况下,wav2letter++ 训练端到端语音识别神经网络的速度比其他优化框架快 2 倍以上。我们还展示了 wav2letter++ 的训练时间在多达 64 块 GPU(我们测试的最高数量)上呈线性扩展,适用于具有 1 亿参数的模型。高性能框架能够实现快速迭代,这往往是在新数据集和任务上成功研究与模型调优的关键因素。

关键词

引用

@article{arxiv.1812.07625,
  title  = {wav2letter++: The Fastest Open-source Speech Recognition System},
  author = {Vineel Pratap and Awni Hannun and Qiantong Xu and Jeff Cai and Jacob Kahn and Gabriel Synnaeve and Vitaliy Liptchinsky and Ronan Collobert},
  journal= {arXiv preprint arXiv:1812.07625},
  year   = {2020}
}