一种用于解释指标并识别自动语音识别中关键错误的范式
计算与语言
2026-05-06 v1
摘要
用于评估自动语音转录的最常用指标,即词错误率(WER)和字符错误率(CER),因其与人类感知的关联性差,无法考虑语言和语义信息而受到广泛批评。虽然已提出基于指标的嵌入,以逼近人类感知,但其分数仍难以解释,不同于 WER 和 CER。本文通过提出一种范式来克服这一问题,即将所选指标纳入其中,以获得等价于错误率的最小编辑距离(minED)。这种方法将转录错误与其人类感知进行对应,也允许从人类视角出发原创性地研究这些错误的严重程度。
引用
@article{arxiv.2605.03671,
title = {A Paradigm for Interpreting Metrics and Identifying Critical Errors in Automatic Speech Recognition},
author = {Thibault Bañeras-Roux and Mickael Rouvier and Jane Wottawa and Richard Dufour},
journal= {arXiv preprint arXiv:2605.03671},
year = {2026}
}