Ika 语自动语音识别
计算与语言
2024-10-03 v1
摘要
我们提出了一种面向低资源语言(如 Ika 语)的成本效益方法,用于开发自动语音识别 (ASR) 模型。我们在来自 Ika 语新约书亚经新约译本编译的高质量语音数据集上对预训练的 wav2vec 2.0 大规模多语言语音模型进行微调。我们的结果表明,仅用超过 1 小时的训练数据,对多语言预训练模型进行微调即可实现词错误率 (WER) 为 0.5377,字符错误率 (CER) 为 0.2651。较大的 10 亿参数模型优于较小的 3 亿参数模型,原因在于其更大的复杂性和存储更丰富语音表示的能力。然而,我们观察到对小训练数据集的过拟合,降低了可泛化性。我们的发现表明,利用多语言预训练模型为低资源语言开发 ASR 模型具有潜力。未来工作应关注扩大数据集并探索缓解过拟合的技术。
关键词
引用
@article{arxiv.2410.00940,
title = {Automatic Speech Recognition for the Ika Language},
author = {Uchenna Nzenwata and Daniel Ogbuigwe},
journal= {arXiv preprint arXiv:2410.00940},
year = {2024}
}
备注
10 pages, 5 Figures This is a pre-release version