中文

使用 PennSound 评估语音识别系统

计算与语言 2025-04-09 v1

摘要

使用来自 PennSound(世界上最大的诗歌朗读和讨论在线集合)的近 10 小时的语音随机样本作为基准来评估几种商业和开源语音识别系统。PennSound 在录音条件和语音风格上的广泛差异使其成为许多其他未转录音频集合的良好代表。由培训合格注释员创建的参考转录文本,以及由 AWS、Azure、Google、IBM、NeMo、Rev.ai、Whisper 和 Whisper.cpp 产生的系统转录文本。根据词错误率,Rev.ai 是最佳表现者,Whisper 是最佳开源表现者(只要避免幻觉)。AWS 在三种系统中拥有最佳分离错误率。然而,WER 和 DER 差异很小,各种权衡可能激励针对不同最终用户选择不同的系统。我们还检查了 Whisper 中的幻觉问题。使用 Whisper 的用户应注意运行选项,以及速度与准确性之间的权衡是否可接受。

关键词

引用

@article{arxiv.2504.05702,
  title  = {Evaluating Speech-to-Text Systems with PennSound},
  author = {Jonathan Wright and Mark Liberman and Neville Ryant and James Fiumara},
  journal= {arXiv preprint arXiv:2504.05702},
  year   = {2025}
}