中文

Earnings-22:真实场景下口音的实用基准

计算与语言 2022-03-30 v1

摘要

现代自动语音识别(ASR)系统已在诸多常见语料上取得超越人类的词错误率(WER),但在真实场景语音上表现不足。此外,缺乏真实世界、带口音的语料来恰当评测学术与商业模型。为确保此类语音在 ASR 评测中得到体现,我们提出 Earnings-22:一个由全球公司财报电话会议收集的 125 个文件、119 小时的英语语料库。我们对 4 个商业模型进行比对,展示了在考虑来源国时的性能差异。通过考察假设转写文本,我们探究了所有被测 ASR 系统共有的错误。借助个体词错误率(IWER)分析,我们发现关键语音特征对某些口音模型性能的影响甚于其他口音。Earnings-22 提供了一个免费使用的真实世界带口音音频基准,以桥接学术与工业研究。

关键词

引用

@article{arxiv.2203.15591,
  title  = {Earnings-22: A Practical Benchmark for Accents in the Wild},
  author = {Miguel Del Rio and Peter Ha and Quinten McNamara and Corey Miller and Shipra Chandra},
  journal= {arXiv preprint arXiv:2203.15591},
  year   = {2022}
}

备注

Submitted to Interspeech 2022