最先进自动语音识别系统中的英语口音准确率分析
音频与语音处理
2021-05-12 v1 计算与语言
机器学习
声音
摘要
如今,得益于近期创建的包含数千录音小时的公共领域语料库,语音技术的研究受益匪浅。这些海量数据对训练基于深度学习技术的新复杂模型非常有帮助。然而,语料库中方言多样性的缺乏已知会导致语音系统出现性能偏差,主要体现在代表性不足的方言上。在本工作中,我们提出使用一个包含来自全球不同国家、标注丰富的多种英语口音且未见过数据的语料库,来评估一个基于深度学习的最先进自动语音识别(ASR)模型。该模型使用名为 Multilingual LibriSpeech 的开放获取语料库中 44.5K 小时的英语语音训练,在流行基准上展现出卓越结果。我们针对从另一持续增长的公共语料库 Common Voice 数据集中提取的样本测试该 ASR 的准确率。随后,我们以图形方式呈现所包含各不同英语口音的按词错误率准确率,表明在口音多样性方面确实存在准确率偏差,偏向于训练语料中最盛行的口音。
引用
@article{arxiv.2105.05041,
title = {English Accent Accuracy Analysis in a State-of-the-Art Automatic Speech Recognition System},
author = {Guillermo Cámbara and Alex Peiró-Lilja and Mireia Farrús and Jordi Luque},
journal= {arXiv preprint arXiv:2105.05041},
year = {2021}
}
备注
2 pages, 1 figure, 1 table. To be published in Phonetics and Phonology in Europe 2021