美洲原住民语言的自动语音识别进展
计算与语言
2024-09-24 v3
摘要
原住民语言是人类交流发展中的基本遗产,体现了美洲当地社区独特的身份和文化。NeurIPS(神经信息处理系统)2022年的第二届AmericasNLP(美洲自然语言处理)竞赛Track 1提出了为五种原住民语言训练自动语音识别(ASR)系统的任务:Quechua、Guarani、Bribri、Kotiria和Wa'ikhana。在本文中,我们描述了针对每种目标语言对SOTA ASR模型进行微调的过程,使用了来自不同来源的约36.65小时的转录语音数据,并通过数据增强方法进行了丰富。我们使用贝叶斯搜索,系统研究了不同超参数对300M和1B参数的Wav2vec2.0 XLS-R(跨语言语音表示)变体的影响。我们的研究结果表明,数据和详细的超参数调优显著影响ASR准确率,但语言复杂性决定了最终结果。Quechua模型取得了最低的字符错误率(CER)(12.14),而Kotiria模型尽管在微调阶段拥有最广泛的数据集,却显示了最高的CER(36.59)。相反,Guarani模型使用最小的数据集,取得了15.59的CER,而Bribri和Wa'ikhana分别取得了34.70和35.23的CER。此外,Sobol'敏感性分析突出了冻结微调更新和dropout率的关键作用。我们发布了每种语言的最佳模型,标志着首个针对Wa'ikhana和Kotiria的开放ASR模型。这项工作为未来研究推进ASR技术以保护少数原住民语言开辟了途径。
引用
@article{arxiv.2404.08368,
title = {Automatic Speech Recognition Advancements for Indigenous Languages of the Americas},
author = {Monica Romero and Sandra Gomez and Ivan G. Torre},
journal= {arXiv preprint arXiv:2404.08368},
year = {2024}
}