打破壁垒:中库尔德语自动语音识别的开创性端到端Transformer范式
音频与语音处理
2024-09-10 v3
摘要
基于端到端Transformer的模型代表了自动语音识别(ASR)系统的最前沿。尽管这些模型具有显著优势,但它们需要大量训练数据才能达到最佳性能,这对中库尔德语等低资源语言构成了重大挑战。解决这一问题需要创新方法和技术。本文旨在通过收集一个鲁棒的语音语料库、使用N-GRAM语言模型以及利用外部库尔德语分词器进行精炼和集成技术来增强模型性能,从而为中库尔德语开发一个ASR系统。我们从不同来源收集了一个包含100小时语音的综合语料库。此外,我们对波斯语、英语和阿拉伯语预训练模型(特别是xls-r-300m、xls-r-1b和xls-r-2b Wav2vec 2.0模型)的语音语料库应用了微调技术。并利用从包含3亿个token的大型文本语料库中训练的3-gram和4-gram语言模型。微调后的xls-r-2b模型结合3-gram语言模型并包含外部库尔德语分词器,取得了最佳性能,在验证集上词错误率(WER)为10.0%,在Asosoft测试集上为11.8%。该ASR模型展示了相比现有库尔德语ASR模型拥有更大词汇量的优势。与其他模型相比,它以更低的错误率产生了更准确和更高性能的结果。
引用
@article{arxiv.2406.02561,
title = {Breaking Walls: Pioneering Automatic Speech Recognition for Central Kurdish: End-to-End Transformer Paradigm},
author = {Abdulhady Abas Abdullah and Hadi Veisi and Tarik Rashid},
journal= {arXiv preprint arXiv:2406.02561},
year = {2024}
}