中文

自动语音识别中偏见的量化

音频与语音处理 2021-04-02 v2 计算与语言 声音

摘要

自动语音识别(ASR)系统承诺对人类语音给出客观解读。实践与近期证据表明,最先进的(SotA) ASR 难以应对由性别、年龄、言语障碍、种族和口音等造成的大幅语音差异。诸多因素可导致 ASR 系统的偏见。我们的总体目标是揭示 ASR 系统中的偏见,以致力于主动的偏见缓解。本文作为该目标的第一步,系统性量化了一个荷兰语 SotA ASR 系统相对于性别、年龄、地区口音与非母语口音的偏见。我们比较了词错误率,并进行了深入的音素级错误分析以理解偏见发生的位置。我们主要关注由数据集中发音差异引起的偏见。基于我们的发现,我们提出了 ASR 开发中的偏见缓解策略。

关键词

引用

@article{arxiv.2103.15122,
  title  = {Quantifying Bias in Automatic Speech Recognition},
  author = {Siyuan Feng and Olya Kudina and Bence Mark Halpern and Odette Scharenborg},
  journal= {arXiv preprint arXiv:2103.15122},
  year   = {2021}
}

备注

Submitted to INTERSPEECH (IS) 2021. This preprint version differs slightly from the version submitted to IS 2021: Figure 1 is not included in IS 2021