中文

在拥抱可持续性的同时揭示偏见:评估自动语音识别系统的双重挑战

计算与语言 2025-03-04 v1 声音 音频与语音处理

摘要

本文对自动语音识别(ASR)系统——即 Whisper 和 Massively Multilingual Speech(MMS)——进行了以偏见与可持续性为重点的调查研究,这两种系统已取得了最先进的(SOTA)性能。尽管其在受控环境下的性能有所提升,但在真实场景中的有效性与公平性方面仍存在关键性的认知空白。我们分析了 ASR 在性别、口音和年龄组方面的偏见,以及其对下游任务的影响。此外,我们考察了 ASR 系统的环境影响,审视大型声学模型对碳排放和能源消耗的影响。我们还提供了实证分析的见解,为 ASR 系统中关于偏见与可持续性的相关论述做出了有价值的贡献。

关键词

引用

@article{arxiv.2503.00907,
  title  = {Unveiling Biases while Embracing Sustainability: Assessing the Dual Challenges of Automatic Speech Recognition Systems},
  author = {Ajinkya Kulkarni and Atharva Kulkarni and Miguel Couceiro and Isabel Trancoso},
  journal= {arXiv preprint arXiv:2503.00907},
  year   = {2025}
}

备注

Interspeech 2024