面向爱尔兰语口语方言识别的研究
计算与语言
2023-07-17 v1 声音
音频与语音处理
摘要
爱尔兰语因其方言和口音的多样性而十分丰富。这加剧了为这一低资源语言创建语音识别系统的难度,因为此类系统必须在语料有限的情况下应对高度变异性。最近一项关于爱尔兰语ASR中方言偏差的研究发现,平衡的训练语料导致了不平等的方言表现,其中阿尔斯特(Ulster)方言的表现始终劣于康诺特(Connacht)或芒斯特(Munster)方言。受此启发,本实验研究了爱尔兰语的口语方言识别,以期将此类系统整合进语音识别流程。我们测试了两种声学分类模型XLS-R和ECAPA-TDNN,并结合使用基于预训练爱尔兰语BERT模型的文本分类器。ECAPA-TDNN,特别是在VoxLingua107数据集上预训练用于语言识别的模型,总体表现最佳,准确率为73%。通过将模型输出与文本模型融合,准确率进一步提升至76%。阿尔斯特方言被最准确地识别,准确率达94%,然而该模型难以区分康诺特和芒斯特方言,这表明可能需要更细致的方法来稳健区分爱尔兰语的各方言。
引用
@article{arxiv.2307.07436,
title = {Towards spoken dialect identification of Irish},
author = {Liam Lonergan and Mengjie Qian and Neasa Ní Chiaráin and Christer Gobl and Ailbhe Ní Chasaide},
journal= {arXiv preprint arXiv:2307.07436},
year = {2023}
}
备注
Accepted to Interspeech 2023 Workshop of the 2nd Annual Meeting of the Special Interest Group of Under-resourced Languages Workshop, Dublin (SiGUL)