中文

一种用于解释指标并识别自动语音识别中关键错误的范式

计算与语言 2026-05-06 v1

摘要

用于评估自动语音转录的最常用指标,即词错误率(WER)和字符错误率(CER),因其与人类感知的关联性差,无法考虑语言和语义信息而受到广泛批评。虽然已提出基于指标的嵌入,以逼近人类感知,但其分数仍难以解释,不同于 WER 和 CER。本文通过提出一种范式来克服这一问题,即将所选指标纳入其中,以获得等价于错误率的最小编辑距离(minED)。这种方法将转录错误与其人类感知进行对应,也允许从人类视角出发原创性地研究这些错误的严重程度。

关键词

引用

@article{arxiv.2605.03671,
  title  = {A Paradigm for Interpreting Metrics and Identifying Critical Errors in Automatic Speech Recognition},
  author = {Thibault Bañeras-Roux and Mickael Rouvier and Jane Wottawa and Richard Dufour},
  journal= {arXiv preprint arXiv:2605.03671},
  year   = {2026}
}