Newcastle 英语自动语音识别偏差的社会语言学分析
计算与语言
2026-03-26 v1 人工智能
计算机视觉与模式识别
声音
摘要
自动语音识别(ASR)系统在日常交流、教育、医疗和产业领域广泛应用,但其性能在说话人之间不均衡,尤其是在方言差异超出训练数据中代表的主流语音 accent 时。本研究通过社会语言学分析 Newcastle 英语——这一北英格兰东部地区的地区变种——来探讨 ASR 偏差。我们使用来自历时电子 Tyneside English 语料库(DECTE)的自发语音,评估了最先进的商业 ASR 系统的输出,并对超过 3000 项转录错误进行细粒度分析。将错误按语言领域分类,并检讨其与性别、年龄和社会经济地位等社会变量之间的关系。此外,声学案例研究选取特定元音特征,展示了梯度音素变异如何直接导致误识别。结果表明,语音学变异占大多数错误的比例, recurrent 失败与方言特定特征(如元音品质和咽化)以及本地词汇和非标准语法形式有关。错误率也随社会群体而异,男性说话人以及年龄极端说话人观察到的错误频率更高。这表明 ASR 错误并非随机发生,而是社会模式化的,并且可以从社会语言学角度解释。该研究表明,在评估和开发语音技术时,必须纳入社会语言学专业知识,并指出更公平的 ASR 系统需要特别关注方言变异和基于社区的语音数据。
关键词
引用
@article{arxiv.2603.24549,
title = {A Sociolinguistic Analysis of Automatic Speech Recognition Bias in Newcastle English},
author = {Dana Serditova and Kevin Tang},
journal= {arXiv preprint arXiv:2603.24549},
year = {2026}
}
备注
54 pages, 11 figures