Holmes:评估语言模型语言能力的基准测试
计算与语言
2026-05-12 v5
摘要
我们介绍 Holmes,这是一个新的基准测试,旨在评估语言模型 (LM) 的语言能力——即其无意识的语言现象理解能力。具体而言,我们使用基于分类器的探针技术来检验 LM 的内部表示对于不同语言现象(例如词性标注)的情况。结果,我们满足了最近呼吁将 LM 的语言能力与其他认知能力(如遵循提示式评估中的指令)区分开来的要求。在构建 Holmes 时,我们审阅了超过 270 项探针研究,并纳入了超过 200 个数据集来评估语法、形态学、语义、推理和语篇现象。分析超过 50 个语言模型后发现,与已知趋势一致的是,他们的语言能力与模型规模相关。但令人惊讶的是,模型架构和指令微调也显著影响性能,尤其在形态学和语法方面。最后,我们提出了 FlashHolmes,这是一个简化版,可在保持高排名精度的同时大幅降低计算负载。
引用
@article{arxiv.2404.18923,
title = {Holmes: A Benchmark to Assess the Linguistic Competence of Language Models},
author = {Andreas Waldis and Yotam Perlitz and Leshem Choshen and Yufang Hou and Iryna Gurevych},
journal= {arXiv preprint arXiv:2404.18923},
year = {2026}
}