为 Kpelle 构建功能机器翻译语料库
计算与语言
2025-05-27 v1
摘要
本文介绍首个面向机器翻译的英语-Kpelle 数据集,包含超过 2000 句对,涵盖日常交流、宗教文本和教育材料。通过对数据集的两个版本对 Meta 的 No Language Left Behind (NLLB) 模型进行微调,我们在 Kpelle 到英语方向实现了最高 30 的 BLEU 分数,展示了数据增强的优势。我们的发现与 NLLB-200 基准在其他非洲语言上的结果一致,凸显了 Kpelle 尽管处于低资源状态,仍具�争性能潜力。除了机器翻译,该数据集还支持语音识别和语言建模等更广泛的 NLP 任务。我们提出了未来数据集扩张的路线图,强调正字法一致性、社区驱动的验证以及跨学科合作,以推动面向 Kpelle 及其他低资源 Mande 语言的包容性语言技术发展。
引用
@article{arxiv.2505.18905,
title = {Building a Functional Machine Translation Corpus for Kpelle},
author = {Kweku Andoh Yamoah and Jackson Weako and Emmanuel J. Dorley},
journal= {arXiv preprint arXiv:2505.18905},
year = {2025}
}