中文

使用 BERTScore 评估语音识别模型在构音障碍语音上的质量

音频与语音处理 2022-09-23 v1 计算与语言 机器学习

摘要

词错误率(WER)是用于评估自动语音识别(ASR)模型质量的主要指标。已有研究表明,ASR模型在言语障碍者上的WER远高于典型英语说话人。很难确定模型在如此高错误率下是否仍有用处。本研究探讨使用BERTScore(一种文本生成评估指标)来提供更具信息量的ASR模型质量与实用性度量。将BERTScore与WER同言语语言病理学家手动标注的错误类型与评估的预测错误进行比较。发现BERTScore与人工对错误类型及评估的判定相关性更高。BERTScore尤其对保留语义的正字法变化(缩略与规范化错误)更为稳健。此外,使用有序逻辑回归与赤池信息准则(AIC)衡量,BERTScore比WER更能拟合错误评估。总体而言,我们的发现表明,从实用角度评估ASR模型性能时,BERTScore可补充WER,尤其对于即便精度低于典型语音仍具实用性的无障碍应用。

关键词

引用

@article{arxiv.2209.10591,
  title  = {Assessing ASR Model Quality on Disordered Speech using BERTScore},
  author = {Jimmy Tobin and Qisheng Li and Subhashini Venugopalan and Katie Seaver and Richard Cave and Katrin Tomanek},
  journal= {arXiv preprint arXiv:2209.10591},
  year   = {2022}
}

备注

Accepted to Interspeech 2022 Workshop on Speech for Social Good