GhanaNLP 平行语料库:为低资源加纳语言提供全面多语言资源
计算与语言
2026-03-31 v2 人工智能
摘要
低资源语言因缺乏数字化和结构完善的语言数据,在自然语言处理领域 presents 独特挑战。为填补这一差距,GhanaNLP 计划开发并精选了41,513对平行句子,涵盖 Twi、Fante、Ewe、Ga 和 Kusaal 语言,这些语言在加纳广泛使用,却在数字空间中被低估。每个数据集均包含本地语言与英语之间精确对齐的句子对。数据由专业人士收集、翻译和标注,并附加标准结构元数据,以确保一致性和可用性。这些语料旨在支持研究、教育和商业应用,包括机器翻译、语音技术和语言保存。本文详细介绍了数据集的创建方法论、结构、用例及评估,并讨论了其在Khaya AI翻译引擎等实际应用中的部署。总体而言,本工作推动了 democratize AI 的更广泛努力,使非洲语言的包容性和可及语言技术得以实现。
引用
@article{arxiv.2603.13793,
title = {GhanaNLP Parallel Corpora: Comprehensive Multilingual Resources for Low-Resource Ghanaian Languages},
author = {Lawrence Adu Gyamfi and Paul Azunre and Stephen Edward Moore and Joel Budu and Akwasi Asare and Mich-Seth Owusu and Jonathan Ofori Asiamah},
journal= {arXiv preprint arXiv:2603.13793},
year = {2026}
}