中文

超越全局指标:面向可解释语音障碍检测系统的公平性分析

音频与语音处理 2025-04-15 v1

摘要

我们对基于现有语音障碍数据集(包含可用人口统计元数据的语音障碍检测系统)进行了全面分析。该研究涉及分析系统在各种人口统计群体中的性能,特别关注性别和年龄人群。基于标准化成本和交叉熵等多个指标进行性能评估。我们采用在预定义人口统计群体上单独训练的校准技术,以解决群体依赖性误校准问题。分析结果显示,尽管存在强大的全局指标,系统仍在不同群体之间表现出显著差异。该系统表现出系统性偏见,将超过 55 岁的健康说话者误判为有语音障碍,同时将 14-30 岁的有障碍说话者误判为健康。群体特定校准改善了后验概率质量,减少了过度自信。对于年轻的有障碍说话者,识别出低严重程度得分是导致系统表现不佳的因素。对于老年说话者,年龄相关的语音特征以及可能限制于用于特征提取的预训练 Hubert 模型,可能影响了结果。该研究表明,全局性能指标对于评估语音障碍检测系统的性能是不够的。群体特定分析可能揭示隐藏于全局指标内的系统性能问题。此外,群体依赖性校准策略有助于减轻偏见,导致对系统置信度的更可靠指示。这些发现强调了在语音障碍检测系统中需要进行人口统计特定的评估和校准的必要性,同时提供了适用于更广泛医疗分类任务中可获得人口统计元数据的方法学框架。

关键词

引用

@article{arxiv.2504.08997,
  title  = {Beyond Global Metrics: A Fairness Analysis for Interpretable Voice Disorder Detection Systems},
  author = {Mariel Estevez and Cyntia Bonomi and Dayana Ribas and Alfonso Ortega and Luciana Ferrer},
  journal= {arXiv preprint arXiv:2504.08997},
  year   = {2025}
}

备注

34 pages, 6 figures, 2 tables