Blackbird 语言矩阵:探讨语言模型语言能力的框架
计算与语言
2026-02-25 v1
摘要
本文描述了一种新型语言任务——Blackbird 语言矩阵 (BLM) 任务,该任务灵感来自智力测试,阐述了 BLM 数据集的构建与基准测试,并展示了针对块化和系统性的针对性实验。BLM 是多层次的多选问题:在每个句子内部、跨越输入序列以及在每个候选答案内部都具有结构。由于其丰富的结构,这些精心挑选但自然的 数据集是回答一些关于当前大型语言模型能力的核心问题的关键:LLM 是否检测语言对象及其属性?它们是否检测并利用跨句子的系统模式?它们更倾向于出现语言错误还是推理错误,以及这些错误如何相互作用。我们展示,尽管 BLM 具有挑战性,但在多个语言中均可实现良好水平的性能表现,既可以使用简单的基线模型,也可通过更精细的模型获得更佳性能。我们指出,这些表示包含解决语言任务所需的语法对象和属性。我们还指出,这些解答是通过检测跨句子的系统模式来实现的。本文支持将精心挑选、结构化的数据集用于语言和大型语言模型属性的多方面调查的观点。由于它们具备精心挑选的结构性、包含学习情境和预期答案的特征,以及部分由人工构建的特点,BLM 属于可以支持可解释性调查、询问大型语言模型为何如此行为的数据集类别。
引用
@article{arxiv.2602.20966,
title = {Blackbird Language Matrices: A Framework to Investigate the Linguistic Competence of Language Models},
author = {Paola Merlo and Chunyang Jiang and Giuseppe Samo and Vivi Nastase},
journal= {arXiv preprint arXiv:2602.20966},
year = {2026}
}
备注
Under review, 46 pages, 5 tables, 28 figures