超越词错误率:通过数据绘图审计语音识别中的多样性税
机器学习
2026-03-06 v1
摘要
自动语音识别(ASR)系统主要使用词错误率(WER)进行评估。然而,原始的词级指标未能捕捉语义保真度,常常掩盖了因系统性识别失败而对被边缘化和非典型说话者所施加的‘多样性税’。本文探索了仅依赖词数统计的局限性,通过系统评估更广泛的非线性和语义指标。为实现严谨的模型审计,我们引入样本难度指数(SDI),这是一种新颖的度量标准,用于量化人口统计特征和声学因素如何驱动模型失败。通过将 SDI 绘制到数据绘图上,我们展示了指标 EmbER 和 SemDist 揭示了 WER 所忽略的隐藏系统性偏见和模型间的不一致。最后,我们的发现是面向 robust 审计框架的第一步,以赋能开发人员在部署前审计和缓解 ASR 的不平等现象。
引用
@article{arxiv.2603.05267,
title = {Beyond Word Error Rate: Auditing the Diversity Tax in Speech Recognition through Dataset Cartography},
author = {Ting-Hui Cheng and Line H. Clemmensen and Sneha Das},
journal= {arXiv preprint arXiv:2603.05267},
year = {2026}
}
备注
Submitted to the Interspeech 2026