中文

metabench——大型语言模型推理与知识的稀疏基准测试

计算与语言 2025-02-21 v2 机器学习 机器学习

摘要

大型语言模型(LLM)在 various tasks 上的能力存在差异。诸如Open LLM Leaderboard等倡议旨在通过几个大型基准测试(包含一组测试项目,LLM可对其作出正确或错误响应)来量化这些差异。然而,基准得分在内部及不同基准之间表现出高相关性,暗示(1)这些基准测量的存在一小组公共底层能力,且(2)项目可能涉及冗余信息,从而可能大幅压缩基准。我们利用来自n > 5000个LLM的数据,识别六个基准(ARC、GSM8K、HellaSwag、MMLU、TruthfulQA和WinoGrande)中最具信息性的项目(总计d = 28,632个项目)。从中提炼出稀疏基准metabench,其规模小于所有六个基准总和的3%。该新稀疏基准超越点评分,能推估底层基准特定能力。我们展示,这些推估值(1)可用于以平均1.24%的均方根误差(RMSE)重建每个原始基准得分,(2)以0.58%的RMSE重建原始总得分,(3)具有单个底层公共因子,其与总得分的斯皮尔曼相关系数为r = 0.94。

关键词

引用

@article{arxiv.2407.12844,
  title  = {metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models},
  author = {Alex Kipnis and Konstantinos Voudouris and Luca M. Schulze Buschoff and Eric Schulz},
  journal= {arXiv preprint arXiv:2407.12844},
  year   = {2025}
}

备注

accepted for publication at ICLR 2025