中文

端到端语音识别:综述

音频与语音处理 2023-03-07 v1 计算与语言 声音

摘要

在过去十年的自动语音识别(ASR)研究中,深度学习的引入带来了相对于无深度学习的建模超过 50% 的词错误率显著下降。在这一转变之后,多种全神经 ASR 架构被提出。这些所谓的端到端(E2E)模型提供了高度集成、完全神经化的 ASR 模型,它们强烈依赖通用机器学习知识,从数据中更一致地学习,同时较少依赖 ASR 领域特定的经验。深度学习的成功与热情采纳,伴随着更通用的模型架构,使得 E2E 模型如今成为主流的 ASR 方法。本综述旨在提供 E2E ASR 模型及相应改进的归类体系,并讨论它们的性质及其与基于经典隐马尔可夫模型(HMM)的 ASR 架构的关系。本工作涵盖了 E2E ASR 的所有相关方面:建模、训练、解码以及外部语言模型集成,并附带对性能与部署机会的讨论,以及对潜在未来发展的展望。

关键词

引用

@article{arxiv.2303.03329,
  title  = {End-to-End Speech Recognition: A Survey},
  author = {Rohit Prabhavalkar and Takaaki Hori and Tara N. Sainath and Ralf Schlüter and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2303.03329},
  year   = {2023}
}

备注

Submitted to IEEE/ACM Transactions on Audio, Speech, and Language Processing