Kencorpus:用于自然语言处理任务的斯瓦希里语、多罗语和卢希亚语肯尼亚语言语料库
计算与语言
2025-01-17 v2
摘要
非洲本土语言在自然语言处理中被归类为服务不足语言,因而经历较差的数字包容性与信息获取。此类语言的处理挑战在于如何在缺乏必要数据的情况下使用机器学习与深度学习模型。Kencorpus项目旨在通过收集和存储足以支持多语社区中机器翻译、问答与转录等应用数据驱动方案的文本与语音数据来弥合此差距。Kencorpus数据集是一个主要于肯尼亚使用的三种语言——斯瓦希里语、多罗语和卢希亚语的文本与语音语料库。数据收集由来自社区、学校、媒体和出版商的研究者完成。Kencorpus数据集含5,594项——4,442文本(5.6M词)与1,152语音文件(177小时)。基于此数据,开发了多罗语与卢希亚语的词性标注集(分别为50,000与93,000词)。我们为斯瓦希里语开发了7,537个问答对,并创建了从多罗语与卢希亚语译为斯瓦希里语的13,400句文本翻译集。该数据集对模型训练与翻译等下游机器学习任务有用。我们还开发了两个概念验证系统:斯瓦希里语语音转文本与用于问答任务的机器学习系统,结果分别为18.87%词错误率与80%精确匹配(EM)。这些初步结果极大彰显了Kencorpus对机器学习界的可用性。Kencorpus是这三种低资源语言的少数公共领域语料库之一,并为类似工作尤其是低资源语言的学习与经验分享奠定基础。
引用
@article{arxiv.2208.12081,
title = {Kencorpus: A Kenyan Language Corpus of Swahili, Dholuo and Luhya for Natural Language Processing Tasks},
author = {Barack Wanjawa and Lilian Wanzare and Florence Indede and Owen McOnyango and Edward Ombui and Lawrence Muchemi},
journal= {arXiv preprint arXiv:2208.12081},
year = {2025}
}
备注
24 pages, 6 figures