在拥抱可持续性的同时揭示偏见:评估自动语音识别系统的双重挑战
计算与语言
2025-03-04 v1 声音
音频与语音处理
摘要
本文对自动语音识别(ASR)系统——即 Whisper 和 Massively Multilingual Speech(MMS)——进行了以偏见与可持续性为重点的调查研究,这两种系统已取得了最先进的(SOTA)性能。尽管其在受控环境下的性能有所提升,但在真实场景中的有效性与公平性方面仍存在关键性的认知空白。我们分析了 ASR 在性别、口音和年龄组方面的偏见,以及其对下游任务的影响。此外,我们考察了 ASR 系统的环境影响,审视大型声学模型对碳排放和能源消耗的影响。我们还提供了实证分析的见解,为 ASR 系统中关于偏见与可持续性的相关论述做出了有价值的贡献。
引用
@article{arxiv.2503.00907,
title = {Unveiling Biases while Embracing Sustainability: Assessing the Dual Challenges of Automatic Speech Recognition Systems},
author = {Ajinkya Kulkarni and Atharva Kulkarni and Miguel Couceiro and Isabel Trancoso},
journal= {arXiv preprint arXiv:2503.00907},
year = {2025}
}
备注
Interspeech 2024