面向自动语音识别的公平性负责任基准测试
计算与语言
2026-05-12 v1
摘要
许多研究表明,自动语音处理系统在不同说话人群 (SG) 之间的性能不均衡。然而,这些研究得出结论的方式不一致。为未来研究奠定更可靠的结果基础,我们依据机器学习公平性、社会科学和语音科学的文献,阐述了对 ASR 公平性基准测试的最佳实践。我们首先描述明确待检验的公平性假设的重要性,并将公平性指标针对该假设进行针对性设计。随后,我们审查了用于评估 ASR 系统公平性的几个基准测试,并讨论了在对 SG 之间交叉情况进行周密监控的情况下,这些结果可能被误解的潜在问题。我们发现,仅基于单一异构 SG(如公平性基准测试中所定义的)进行公平性评估,可能导致误认哪些 SG 实际上受 ASR 系统的误待。我们主张对尽可能细致地分析尽可能多的人口统计变量在公平性语料库元数据中的交叉性,以澄清此类伪相关现象。
引用
@article{arxiv.2605.10615,
title = {Responsible Benchmarking of Fairness for Automatic Speech Recognition},
author = {Felix Herron and Ange Richard and François Portet and Alexandre Allauzen and Solange Rossato},
journal= {arXiv preprint arXiv:2605.10615},
year = {2026}
}