中文

ESB:一种面向多领域端到端语音识别的基准

计算与语言 2022-10-25 v1 声音 音频与语音处理

摘要

语音识别应用涵盖了一系列不同的音频与文本分布,具有不同的说话风格、背景噪声、转录标点及字符大小写。然而,许多语音识别系统需要针对特定数据集进行调优(音频滤波、标点移除与大小写规范化),因此假定了对音频与文本分布的先验知识。这种调优需求可能导致系统无法泛化到其他数据集与领域。为促进多领域语音系统的研发,我们引入了端到端语音基准(ESB),用于在广泛语音数据集上评估单一自动语音识别(ASR)系统的性能。被基准化的系统必须在各数据集上使用相同的数据预处理与后处理算法——假定音频与文本数据分布是先验未知的。我们在此基准上比较了一系列最先进(SoTA)的端到端(E2E)系统,展示了单一语音系统如何被应用并评估于广泛的数据分布。我们发现 E2E 系统在各数据集上均有效:在公平比较中,E2E 系统与针对特定数据集调优的 SoTA 系统差距在 2.6% 以内。我们的分析揭示,转录伪影(如标点和大小写)给 ASR 系统带来困难,应被纳入评估。我们相信跨多个数据集的 E2E 基准有助于多领域语音识别系统的研究。ESB 可在 https://huggingface.co/esb 获取。

关键词

引用

@article{arxiv.2210.13352,
  title  = {ESB: A Benchmark For Multi-Domain End-to-End Speech Recognition},
  author = {Sanchit Gandhi and Patrick von Platen and Alexander M. Rush},
  journal= {arXiv preprint arXiv:2210.13352},
  year   = {2022}
}

备注

25 pages, 1 figure, submitted to ICLR 2023