中文

端到端 ASR 模型是否已准备好工业应用?

音频与语音处理 2022-10-24 v2 人工智能 计算与语言 声音

摘要

随着全神经(端到端,E2E)方法的兴起,自动语音识别(ASR)社区正经历一个重大转折点。与此同时,传统的混合模型仍是 ASR 实际使用的标准选择。根据先前的研究,E2E ASR 在现实世界应用中的采用受到两个主要限制:其对未见领域的泛化能力以及其高运算成本。在本文中,我们通过对若干当代 E2E 模型和一个混合基线进行全面的多领域基准测试,来研究上述两个缺陷。我们的实验表明,E2E 模型是混合方法的可行替代方案,并且在准确率和运算效率上都优于基线。因此,我们的研究表明泛化和复杂度问题不再是工业集成的重大障碍,并将社区的注意力吸引到 E2E 方法在某些特定用例中的其他潜在限制上。

关键词

引用

@article{arxiv.2112.12572,
  title  = {Are E2E ASR models ready for an industrial usage?},
  author = {Valentin Vielzeuf and Grigory Antipov},
  journal= {arXiv preprint arXiv:2112.12572},
  year   = {2022}
}