GaelEval:面向斯凯蒂语 LLM 性能的基准测试
计算与语言
2026-04-03 v1
摘要
多语言大型语言模型(LLM)常表现出在无官方支持语言上的突现“影子”能力,但其在这些语言上的性能不均且缺乏测量。这在形态语法丰富的少数语言如斯凯蒂语(Scottish Gaelic)上尤为突出,因翻译基准测试难以捕捉结构能力。我们引入 GaelEval,首个针对斯凯蒂语的多维基准测试,包括:(i)由专家编写的形态语法多选问答任务;(ii)文化嵌入式翻译基准测试;(iii)大规模文化知识问答任务。我们评估了 19 个 LLM 对比流利斯托人类基线(),发现 Gemini 3 Pro Preview 在语言任务中取得 的准确率,超越人类基线()。专有模型在一致上优于开源权重系统,Gaelic 提示词可带来小幅稳定优势(+)。在文化任务中,领先模型准确率超过 ,尽管大多数系统在斯凯蒂语提示词下表现更差且绝对分数相对于手动基准偏高。总体而言,GaelEval 揭示了前沿模型在斯凯蒂语语法多个维度上实现了超人类水平,展示了斯凯蒂语提示词的效果,并显示专有模型在性能上优于开源模型的持久差距。
引用
@article{arxiv.2604.02135,
title = {GaelEval: Benchmarking LLM Performance for Scottish Gaelic},
author = {Peter Devine and William Lamb and Beatrice Alex and Ignatius Ezeani and Dawn Knight and Mícheál J. Ó Meachair and Paul Rayson and Martin Wynne},
journal= {arXiv preprint arXiv:2604.02135},
year = {2026}
}
备注
13 pages, to be published in Proceedings of LLMs4SSH (workshop co-located with LREC 2026; Mallorca, Spain; May 2026)