中文

Deep Speech 2:英语与普通话的端到端语音识别

计算与语言 2015-12-09 v1

摘要

我们展示了端到端深度学习方法可用于识别英语或普通话语音——两种差异极大的语言。由于该方法用神经网络替代了整个手工设计组件的流水线,端到端学习使我们能够处理包括噪声环境、口音和不同语言在内的多样化语音。我们方法的关键在于应用了高性能计算(HPC)技术,从而相比先前系统实现了7倍加速。得益于该效率,先前需数周的实验如今在数日内完成。这使我们能够更快速地迭代以识别更优的架构和算法。因此,在多种情况下,我们的系统在标准数据集基准测试中与人工转写人员具有竞争力。最后,通过使用一种称为数据中心内GPU批量调度(Batch Dispatch)的技术,我们展示了我们的系统可以低成本部署于在线环境,在大规模服务用户时提供低延迟。

关键词

引用

@article{arxiv.1512.02595,
  title  = {Deep Speech 2: End-to-End Speech Recognition in English and Mandarin},
  author = {Dario Amodei and Rishita Anubhai and Eric Battenberg and Carl Case and Jared Casper and Bryan Catanzaro and Jingdong Chen and Mike Chrzanowski and Adam Coates and Greg Diamos and Erich Elsen and Jesse Engel and Linxi Fan and Christopher Fougner and Tony Han and Awni Hannun and Billy Jun and Patrick LeGresley and Libby Lin and Sharan Narang and Andrew Ng and Sherjil Ozair and Ryan Prenger and Jonathan Raiman and Sanjeev Satheesh and David Seetapun and Shubho Sengupta and Yi Wang and Zhiqian Wang and Chong Wang and Bo Xiao and Dani Yogatama and Jun Zhan and Zhenyao Zhu},
  journal= {arXiv preprint arXiv:1512.02595},
  year   = {2015}
}