爱尔兰- BLiMP:面向低资源环境中人类与语言模型语言学能力的基准测试
计算与语言
2025-10-27 v1
摘要
我们提出 Irish-BLiMP(Irish Benchmark of Linguistic Minimal Pairs),第一个为爱尔兰语这种濒危语言设计的细粒度语言能力评估数据集和框架。我们基于多种语言学文献和语法参考书目,由一组流利的爱尔兰语学习者手动构建并审阅了 1020 个最小配对,覆盖 11 个语言学特征的分类体系。我们对现有的大型语言模型(LLM)和流利的 human 参与者都进行了爱尔兰语语法知识的评估。我们的发现显示,人类在所有语言学特征上均优于所有模型,平均准确率高出 16.6%。此外,开源与闭源 LLM 之间存在约 18.1% 的显著性能差距,即使是最强的模型(gpt-5)也仅达到 73.5% 的准确率,而人类达到 90.1%。有趣的是,人类参与者和模型在爱尔兰语语法的不同方面受挫,因此凸显了模型所学习的表示差异。总体而言,Irish-BLiMP 提供了评估爱尔兰语 LLM 语法competence 的首个系统框架,并为推动低资源语言语言理解研究提供了宝贵的基准。
引用
@article{arxiv.2510.20957,
title = {Irish-BLiMP: A Linguistic Benchmark for Evaluating Human and Language Model Performance in a Low-Resource Setting},
author = {Josh McGiff and Khanh-Tung Tran and William Mulcahy and Dáibhidh Ó Luinín and Jake Dalzell and Róisín Ní Bhroin and Adam Burke and Barry O'Sullivan and Hoang D. Nguyen and Nikola S. Nikolov},
journal= {arXiv preprint arXiv:2510.20957},
year = {2025}
}
备注
8 pages