跨世界语言的大语言模型语言学知识评估
计算与语言
2026-02-13 v2
摘要
大语言模型(LLM)在语言使用方面通常被评估,但其关于语言结构的显式知识仍 poorly 被理解。现有语言学基准关注狭窄现象,强调高资源语言,很少测试语言学知识——即关于语言结构的显式推理。我们提出了一个针对大语言模型中语言学知识的多语言评估,基于世界语言结构图谱(WALS),该图谱记录了 192 项语言特征,覆盖 2,660 种语言。我们将 WALS 特征转换为自然语言多选问题,并在记录的语言中对模型进行评估。我们使用准确率和宏 F1 分数,以及与随机和多数类基线的比较,评估性能并分析不同语言学领域和语言相关因素的差异。结果显示,语言学知识有限:GPT-4o 表现最佳,但仅达到 moderate 的准确率(0.367),而开源模型滞后。尽管所有模型都在随机水平以上,但它们未能超过多数类基线,这表明它们捕获了广泛的跨语言模式,但缺乏细粒度的区分。性能因领域而异,部分反映了在线可见性的差异。在语言层面,准确率与数字语言状态相关联:具有更大数字存在和资源的语言评估得分更高,而低资源语言表现较差。分析预测因素确认,资源相关指标(维基百科规模、语料可用性)比地理、族谱或社会语言因素更具信息性。总体而言,大语言模型的语言学知识呈现碎片化,主要受数据可用性影响,而非广泛可通用的语法能力。我们将该基准作为开源数据集发布,以支持跨语言评估,并鼓励未来大语言模型在全球语言多样性方面取得进展。
引用
@article{arxiv.2602.02182,
title = {Evaluating Metalinguistic Knowledge in Large Language Models across the World's Languages},
author = {Tjaša Arčon and Matej Klemen and Marko Robnik-Šikonja and Kaja Dobrovoljc},
journal= {arXiv preprint arXiv:2602.02182},
year = {2026}
}