UrBLiMP:评估大型语言模型在乌尔都语语言competence的基准
计算与语言
2025-08-05 v1
摘要
多语言大型语言模型(LLMs)在 various languages上显示出惊人的性能;然而,它们在低资源语言(如乌尔都语)的数据方面显著不足,而高资源语言(如英语)则相对丰富。为了评估LLMs在乌尔都语中的语言知识,我们提出乌尔都语言最低配对基准(UrBLiMP),即 minimally different句子对,分别在语法可接受性上进行对比。UrBLiMP包含5,696个最低配对,针对十个核心句法现象精心挑选,采用乌尔都语树库和多样化乌尔都语文本语料库进行构建。对UrBLiMP注释的人类评估结果显示,96.10%的注释间一致性,确认了数据集的可靠性。我们对二十个多语言LLMs在UrBLiMP上的表现进行评估,结果显示不同句法现象之间的表现存在显著差异。虽然LLaMA-3-70B在平均准确率(94.73%)上取得最高分,但其表现在统计上与其他顶级模型(如Gemma-3-27B-PT)相当。这些发现既凸显了当前多语言LLMs在捕捉低资源语言中细粒度句法知识方面的潜力,也揭示了其局限性。
引用
@article{arxiv.2508.01006,
title = {UrBLiMP: A Benchmark for Evaluating the Linguistic Competence of Large Language Models in Urdu},
author = {Farah Adeeba and Brian Dillon and Hassan Sajjad and Rajesh Bhatt},
journal= {arXiv preprint arXiv:2508.01006},
year = {2025}
}