迷失在转录中:识别并量化自动语音识别系统针对非流利语音的准确性偏差
计算与语言
2024-05-13 v1 计算机与社会
音频与语音处理
摘要
自动语音识别(ASR)系统在教育、医疗、就业和移动技术领域日益普及,但在包容性方面面临重大挑战,特别是对于全球8000万口吃者群体。这些系统通常无法准确解释偏离典型流利度的语音模式,导致严重的可用性问题和误解。本研究评估了六种领先的ASR系统,分析了它们在来自口吃者语音样本的真实世界数据集和源自广泛使用的LibriSpeech基准的合成数据集上的性能。该合成数据集经过独特设计,融入了各种口吃事件,能够深入分析每个ASR系统处理非流利语音的能力。我们的综合评估指标包括词错误率(WER)、字符错误率(CER)以及转录文本的语义准确性。结果揭示了所有ASR系统对非流利语音存在一致且统计显著的准确性偏差,表现为转录中显著的句法和语义不准确。这些发现凸显了当前ASR技术中的一个关键差距,强调了制定有效偏差缓解策略的必要性。解决这种偏差不仅对于提高口吃者的技术可用性至关重要,而且对于确保他们在快速发展的数字环境中公平和包容地参与也至关重要。
引用
@article{arxiv.2405.06150,
title = {Lost in Transcription: Identifying and Quantifying the Accuracy Biases of Automatic Speech Recognition Systems Against Disfluent Speech},
author = {Dena Mujtaba and Nihar R. Mahapatra and Megan Arney and J. Scott Yaruss and Hope Gerlach-Houck and Caryn Herring and Jia Bin},
journal= {arXiv preprint arXiv:2405.06150},
year = {2024}
}
备注
Accepted to NAACL 2024