Nsanku:评估大语言模型在 Ghana 语语言上零样态翻译性能的基准测试
计算与语言
2026-05-07 v1
摘要
大型语言模型 (LLM) 在资源丰富的语言上展现了惊人的多语言能力,但其在低资源非洲语言上的表现仍鲜有了解且缺乏系统评估。本文提出了 Nsanku,一个系统性基准,用于评估 19 个开源和商业大语言模型在 43 种 Ghana 语语言与英语之间的零样态机器翻译性能。评估句子来源于 YouVersion 圣经平台,提供每种语言 300 句句对。本文采用两种互补的自动评估指标:双语评估学习 (BLEU) 和字符 n 元语法 F 分数 (chrF),并计算平均准确率及跨语言一致性维度。Nsanku 是迄今为止最全面的 Ghana 语语言大语言模型翻译评估。结果显示,gemini-2.5-flash 获得最高的总体平均得分 26.88(BLEU: 24.60,chrF: 29.16),其后为 claude-sonnet-4-5 以 24.87(BLEU: 22.46,chrF: 27.28)和 gpt-4.1 以 23.20(BLEU: 21.15,chrF: 25.24)位列次之。开源模型中,kimi-k2-instruct-0905 以 20.87 的平均得分领先。一致性分析的关键发现是,没有任何模型或语言同时达到高性能与高一致性的领导者象限,这表明当前大语言模型尚不可可靠地大规模用于 Ghana 语语言翻译。Siwu 在单语言平均得分上取得最高值 25.73,而 Nkonya 最低为 11.65。Nsanku 建立了一个面向非洲语言自然语言处理研究的公开、可社区扩展的评估基础设施。
引用
@article{arxiv.2605.04208,
title = {Nsanku: Evaluating Zero-Shot Translation Performance of LLMs for Ghanaian Languages},
author = {Stephen E. Moore and Mich-Seth Owusu and Akwasi Asare and Lawrence Adu Gyamfi and Paul Azunre and Joel Budu and Jonathan Asiamah and Elias Dzobo and Kelvin Newman and Edmund O. Benefo and Gerhardt Datsomor and Onesimus Addo Appiah and Ama Branoa Banful and Lucas Woedem Kpatah and Saani Mustapha Deishini and John Ayernor},
journal= {arXiv preprint arXiv:2605.04208},
year = {2026}
}