中文

端到端自动语音识别的最新进展

音频与语音处理 2022-02-04 v2 人工智能 计算与语言 声音

摘要

近年来,语音社区正见证着一个重要趋势,即从基于深度神经网络的混合建模转向用于自动语音识别(ASR)的端到端(E2E)建模。尽管端到端模型在大多数基准测试中取得了最先进的 ASR 准确率结果,但混合模型目前仍在大部分商业 ASR 系统中使用。有许多实际因素影响着生产模型部署的决策。传统的混合模型经过数十年的生产优化,通常在这些因素上表现良好。如果不能为所有这些因素提供出色的解决方案,端到端模型很难被广泛商业化。在本文中,我们将概述端到端模型的最新进展,重点关注从行业角度解决这些挑战的技术。

关键词

引用

@article{arxiv.2111.01690,
  title  = {Recent Advances in End-to-End Automatic Speech Recognition},
  author = {Jinyu Li},
  journal= {arXiv preprint arXiv:2111.01690},
  year   = {2022}
}

备注

Accepted at APSIPA Transactions on Signal and Information Processing