中文

增量设定下自动语音识别的评估

计算与语言 2023-02-24 v1 声音 音频与语音处理

摘要

自动语音识别可靠性的提升使其在日常使用中迅速普及。然而,出于研究目的,通常不清楚应为某任务选择何种模型,尤其在既要求速度又要求准确性的情况下。本文使用包括词错误率、延迟以及对已识别词的更新次数在内的指标系统评估了六种语音识别器,并在英语测试数据上提出并比较了两种将音频流式输入识别器以实现增量识别的方法。我们进一步提出每秒撤销数(Revokes per Second)作为评估增量识别的新指标,并证明其可洞察模型整体性能。我们发现,总体而言,本地识别器比云端识别器更快且需要更少的更新。最后,我们发现 Meta 的 Wav2Vec 模型最快,而 Mozilla 的 DeepSpeech 模型预测最稳定。

关键词

引用

@article{arxiv.2302.12049,
  title  = {Evaluating Automatic Speech Recognition in an Incremental Setting},
  author = {Ryan Whetten and Mir Tahsin Imtiaz and Casey Kennington},
  journal= {arXiv preprint arXiv:2302.12049},
  year   = {2023}
}

备注

5 pages