利用音频分类改善非裔美国英语的语音识别
音频与语音处理
2023-09-20 v1 计算与语言
机器学习
声音
摘要
自动语音识别(ASR)系统已被证明在其预期或期望识别的语言变体之间存在巨大的质量差异。缓解此问题的一种方法是使用更具代表性的数据集训练或微调模型。但该方法可能受限于有限的领域内训练与评估数据。我们提出了一种利用少量域外(长形式)非裔美国英语(AAE)数据提升美国英语短形式语音识别器鲁棒性的新方法。我们使用 CORAAL、YouTube 和 Mozilla Common Voice 训练一个音频分类器,以近似输出一段话语是 AAE 还是包括主流美国英语(MAE)在内的其他变体。通过将分类器输出与粗略地理信息结合,我们可从大规模无转写短形式查询语料中选取子集,用于大规模的半监督学习。在此数据上微调后,AAE 与 MAE 之间的相对词错误率差异减少了 38.5%,且不降低 MAE 质量。
引用
@article{arxiv.2309.09996,
title = {Improving Speech Recognition for African American English With Audio Classification},
author = {Shefali Garg and Zhouyuan Huo and Khe Chai Sim and Suzan Schwartz and Mason Chua and Alëna Aksënova and Tsendsuren Munkhdalai and Levi King and Darryl Wright and Zion Mengesha and Dongseong Hwang and Tara Sainath and Françoise Beaufays and Pedro Moreno Mengibar},
journal= {arXiv preprint arXiv:2309.09996},
year = {2023}
}